mkurman's picture
Upload checkpoint-51000 at step 51000
c1bab0e verified
Raw
History Blame Contribute Delete
460 kB
{
"best_global_step": 43000,
"best_metric": 1.4149765968322754,
"best_model_checkpoint": "/home/mkurman/gitlab/ai/model-trainer/results/convgpt_v2_long_2d/convgpt_v2_rope_nope_hybrid_clean_h512_l16_seq512_bs8_fullloss_20260523_161605/checkpoint-43000",
"epoch": 0.0005,
"eval_steps": 1000,
"global_step": 51000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00013167943957230517,
"grad_norm": 1.5129085779190063,
"learning_rate": 1.8762343647136274e-05,
"loss": 10.0451,
"step": 20
},
{
"epoch": 0.00026335887914461035,
"grad_norm": 1.4276129007339478,
"learning_rate": 3.851217906517446e-05,
"loss": 9.11,
"step": 40
},
{
"epoch": 0.00039503831871691555,
"grad_norm": 1.3658931255340576,
"learning_rate": 5.8262014483212636e-05,
"loss": 8.3876,
"step": 60
},
{
"epoch": 0.0005267177582892207,
"grad_norm": 1.8227916955947876,
"learning_rate": 7.801184990125083e-05,
"loss": 7.7517,
"step": 80
},
{
"epoch": 0.0006583971978615259,
"grad_norm": 0.8309405446052551,
"learning_rate": 9.7761685319289e-05,
"loss": 7.1243,
"step": 100
},
{
"epoch": 0.0007900766374338311,
"grad_norm": 0.6047381162643433,
"learning_rate": 0.00011751152073732718,
"loss": 6.5642,
"step": 120
},
{
"epoch": 0.0009217560770061363,
"grad_norm": 6.724730014801025,
"learning_rate": 0.00013726135615536539,
"loss": 6.1814,
"step": 140
},
{
"epoch": 0.0010534355165784414,
"grad_norm": 0.4805045425891876,
"learning_rate": 0.00015701119157340358,
"loss": 5.8953,
"step": 160
},
{
"epoch": 0.0011851149561507466,
"grad_norm": 0.4253923296928406,
"learning_rate": 0.00017676102699144174,
"loss": 5.656,
"step": 180
},
{
"epoch": 0.0013167943957230518,
"grad_norm": 0.479189395904541,
"learning_rate": 0.0001965108624094799,
"loss": 5.453,
"step": 200
},
{
"epoch": 0.001448473835295357,
"grad_norm": 0.4821586310863495,
"learning_rate": 0.0002162606978275181,
"loss": 5.2631,
"step": 220
},
{
"epoch": 0.0015801532748676622,
"grad_norm": 0.5253534913063049,
"learning_rate": 0.0002360105332455563,
"loss": 5.1262,
"step": 240
},
{
"epoch": 0.0017118327144399674,
"grad_norm": 0.3778499662876129,
"learning_rate": 0.0002557603686635945,
"loss": 4.9729,
"step": 260
},
{
"epoch": 0.0018435121540122726,
"grad_norm": 0.40282198786735535,
"learning_rate": 0.0002755102040816327,
"loss": 4.8491,
"step": 280
},
{
"epoch": 0.0019751915935845776,
"grad_norm": 0.40169110894203186,
"learning_rate": 0.00029526003949967083,
"loss": 4.7163,
"step": 300
},
{
"epoch": 0.002106871033156883,
"grad_norm": 0.4091223180294037,
"learning_rate": 0.000315009874917709,
"loss": 4.6122,
"step": 320
},
{
"epoch": 0.002238550472729188,
"grad_norm": 0.3836401402950287,
"learning_rate": 0.0003347597103357472,
"loss": 4.5315,
"step": 340
},
{
"epoch": 0.002370229912301493,
"grad_norm": 0.37077072262763977,
"learning_rate": 0.0003545095457537854,
"loss": 4.4403,
"step": 360
},
{
"epoch": 0.0025019093518737984,
"grad_norm": 0.3423950970172882,
"learning_rate": 0.0003742593811718236,
"loss": 4.3758,
"step": 380
},
{
"epoch": 0.0026335887914461036,
"grad_norm": 0.3271167576313019,
"learning_rate": 0.00039400921658986173,
"loss": 4.2859,
"step": 400
},
{
"epoch": 0.002765268231018409,
"grad_norm": 0.32271647453308105,
"learning_rate": 0.0004137590520079,
"loss": 4.2281,
"step": 420
},
{
"epoch": 0.002896947670590714,
"grad_norm": 0.3268634080886841,
"learning_rate": 0.00043350888742593816,
"loss": 4.152,
"step": 440
},
{
"epoch": 0.003028627110163019,
"grad_norm": 0.3095104992389679,
"learning_rate": 0.00045325872284397636,
"loss": 4.0894,
"step": 460
},
{
"epoch": 0.0031603065497353244,
"grad_norm": 0.33799174427986145,
"learning_rate": 0.00047300855826201455,
"loss": 4.0365,
"step": 480
},
{
"epoch": 0.0032919859893076296,
"grad_norm": 0.39443933963775635,
"learning_rate": 0.0004927583936800527,
"loss": 3.9868,
"step": 500
},
{
"epoch": 0.003423665428879935,
"grad_norm": 0.32354313135147095,
"learning_rate": 0.0005125082290980909,
"loss": 3.9136,
"step": 520
},
{
"epoch": 0.00355534486845224,
"grad_norm": 0.31924670934677124,
"learning_rate": 0.0005322580645161291,
"loss": 3.8859,
"step": 540
},
{
"epoch": 0.0036870243080245452,
"grad_norm": 0.2883984446525574,
"learning_rate": 0.0005520078999341672,
"loss": 3.8321,
"step": 560
},
{
"epoch": 0.0038187037475968504,
"grad_norm": 0.31237614154815674,
"learning_rate": 0.0005717577353522054,
"loss": 3.799,
"step": 580
},
{
"epoch": 0.003950383187169155,
"grad_norm": 0.29551151394844055,
"learning_rate": 0.0005915075707702436,
"loss": 3.7745,
"step": 600
},
{
"epoch": 0.004082062626741461,
"grad_norm": 0.2833958566188812,
"learning_rate": 0.0006112574061882818,
"loss": 3.7411,
"step": 620
},
{
"epoch": 0.004213742066313766,
"grad_norm": 0.28037381172180176,
"learning_rate": 0.00063100724160632,
"loss": 3.6861,
"step": 640
},
{
"epoch": 0.004345421505886071,
"grad_norm": 0.39652886986732483,
"learning_rate": 0.0006507570770243582,
"loss": 3.6568,
"step": 660
},
{
"epoch": 0.004477100945458376,
"grad_norm": 0.2646957337856293,
"learning_rate": 0.0006705069124423963,
"loss": 3.6185,
"step": 680
},
{
"epoch": 0.004608780385030682,
"grad_norm": 0.2843409478664398,
"learning_rate": 0.0006902567478604345,
"loss": 3.5845,
"step": 700
},
{
"epoch": 0.004740459824602986,
"grad_norm": 0.27913448214530945,
"learning_rate": 0.0007100065832784727,
"loss": 3.5546,
"step": 720
},
{
"epoch": 0.004872139264175292,
"grad_norm": 0.2710491418838501,
"learning_rate": 0.0007297564186965109,
"loss": 3.5176,
"step": 740
},
{
"epoch": 0.005003818703747597,
"grad_norm": 0.28077027201652527,
"learning_rate": 0.0007495062541145491,
"loss": 3.497,
"step": 760
},
{
"epoch": 0.0051354981433199024,
"grad_norm": 0.27605777978897095,
"learning_rate": 0.0007692560895325872,
"loss": 3.4649,
"step": 780
},
{
"epoch": 0.005267177582892207,
"grad_norm": 0.29779553413391113,
"learning_rate": 0.0007890059249506255,
"loss": 3.4509,
"step": 800
},
{
"epoch": 0.005398857022464512,
"grad_norm": 0.3055330812931061,
"learning_rate": 0.0008087557603686636,
"loss": 3.4085,
"step": 820
},
{
"epoch": 0.005530536462036818,
"grad_norm": 0.26349249482154846,
"learning_rate": 0.0008285055957867019,
"loss": 3.3842,
"step": 840
},
{
"epoch": 0.005662215901609122,
"grad_norm": 0.2677903175354004,
"learning_rate": 0.00084825543120474,
"loss": 3.3555,
"step": 860
},
{
"epoch": 0.005793895341181428,
"grad_norm": 0.2856537699699402,
"learning_rate": 0.0008680052666227783,
"loss": 3.3358,
"step": 880
},
{
"epoch": 0.005925574780753733,
"grad_norm": 0.2631045877933502,
"learning_rate": 0.0008877551020408163,
"loss": 3.3164,
"step": 900
},
{
"epoch": 0.006057254220326038,
"grad_norm": 0.2708953619003296,
"learning_rate": 0.0009075049374588546,
"loss": 3.2944,
"step": 920
},
{
"epoch": 0.006188933659898343,
"grad_norm": 0.24445629119873047,
"learning_rate": 0.0009272547728768927,
"loss": 3.2718,
"step": 940
},
{
"epoch": 0.006320613099470649,
"grad_norm": 0.2704775035381317,
"learning_rate": 0.0009470046082949309,
"loss": 3.249,
"step": 960
},
{
"epoch": 0.006452292539042954,
"grad_norm": 0.25395041704177856,
"learning_rate": 0.000966754443712969,
"loss": 3.2161,
"step": 980
},
{
"epoch": 0.006583971978615259,
"grad_norm": 0.2632465064525604,
"learning_rate": 0.0009865042791310074,
"loss": 3.1973,
"step": 1000
},
{
"epoch": 0.006583971978615259,
"eval_loss": 3.229322671890259,
"eval_runtime": 68.051,
"eval_samples_per_second": 14.695,
"eval_steps_per_second": 14.695,
"step": 1000
},
{
"epoch": 0.006715651418187564,
"grad_norm": 0.268993079662323,
"learning_rate": 0.0010062541145490454,
"loss": 3.1752,
"step": 1020
},
{
"epoch": 0.00684733085775987,
"grad_norm": 0.2427850067615509,
"learning_rate": 0.0010260039499670837,
"loss": 3.1407,
"step": 1040
},
{
"epoch": 0.006979010297332174,
"grad_norm": 0.2634700834751129,
"learning_rate": 0.0010457537853851217,
"loss": 3.122,
"step": 1060
},
{
"epoch": 0.00711068973690448,
"grad_norm": 0.23194676637649536,
"learning_rate": 0.00106550362080316,
"loss": 3.0935,
"step": 1080
},
{
"epoch": 0.007242369176476785,
"grad_norm": 0.25881442427635193,
"learning_rate": 0.0010852534562211982,
"loss": 3.0758,
"step": 1100
},
{
"epoch": 0.0073740486160490904,
"grad_norm": 0.2772982716560364,
"learning_rate": 0.0011050032916392364,
"loss": 3.0621,
"step": 1120
},
{
"epoch": 0.007505728055621395,
"grad_norm": 0.25508975982666016,
"learning_rate": 0.0011247531270572745,
"loss": 3.0338,
"step": 1140
},
{
"epoch": 0.007637407495193701,
"grad_norm": 0.2273252010345459,
"learning_rate": 0.0011445029624753127,
"loss": 3.0122,
"step": 1160
},
{
"epoch": 0.007769086934766006,
"grad_norm": 0.25050970911979675,
"learning_rate": 0.001164252797893351,
"loss": 3.0121,
"step": 1180
},
{
"epoch": 0.00790076637433831,
"grad_norm": 0.24488165974617004,
"learning_rate": 0.0011840026333113892,
"loss": 2.9993,
"step": 1200
},
{
"epoch": 0.008032445813910615,
"grad_norm": 0.23485834896564484,
"learning_rate": 0.0012037524687294272,
"loss": 2.9679,
"step": 1220
},
{
"epoch": 0.008164125253482922,
"grad_norm": 0.23405972123146057,
"learning_rate": 0.0012235023041474655,
"loss": 2.9485,
"step": 1240
},
{
"epoch": 0.008295804693055226,
"grad_norm": 0.20557770133018494,
"learning_rate": 0.0012432521395655035,
"loss": 2.931,
"step": 1260
},
{
"epoch": 0.008427484132627531,
"grad_norm": 0.22637082636356354,
"learning_rate": 0.001263001974983542,
"loss": 2.9185,
"step": 1280
},
{
"epoch": 0.008559163572199836,
"grad_norm": 0.21511614322662354,
"learning_rate": 0.00128275181040158,
"loss": 2.9059,
"step": 1300
},
{
"epoch": 0.008690843011772142,
"grad_norm": 0.20529645681381226,
"learning_rate": 0.0013025016458196182,
"loss": 2.8874,
"step": 1320
},
{
"epoch": 0.008822522451344447,
"grad_norm": 0.19764812290668488,
"learning_rate": 0.0013222514812376563,
"loss": 2.8646,
"step": 1340
},
{
"epoch": 0.008954201890916752,
"grad_norm": 0.2055043876171112,
"learning_rate": 0.0013420013166556945,
"loss": 2.849,
"step": 1360
},
{
"epoch": 0.009085881330489057,
"grad_norm": 0.1990618258714676,
"learning_rate": 0.0013617511520737328,
"loss": 2.8303,
"step": 1380
},
{
"epoch": 0.009217560770061363,
"grad_norm": 0.19160950183868408,
"learning_rate": 0.001381500987491771,
"loss": 2.827,
"step": 1400
},
{
"epoch": 0.009349240209633668,
"grad_norm": 0.19032776355743408,
"learning_rate": 0.001401250822909809,
"loss": 2.8059,
"step": 1420
},
{
"epoch": 0.009480919649205973,
"grad_norm": 0.18810242414474487,
"learning_rate": 0.0014210006583278473,
"loss": 2.8056,
"step": 1440
},
{
"epoch": 0.009612599088778278,
"grad_norm": 0.18992900848388672,
"learning_rate": 0.0014407504937458853,
"loss": 2.7846,
"step": 1460
},
{
"epoch": 0.009744278528350584,
"grad_norm": 0.18800954520702362,
"learning_rate": 0.0014605003291639238,
"loss": 2.7688,
"step": 1480
},
{
"epoch": 0.009875957967922889,
"grad_norm": 0.19007734954357147,
"learning_rate": 0.0014802501645819618,
"loss": 2.7639,
"step": 1500
},
{
"epoch": 0.010007637407495194,
"grad_norm": 0.18421195447444916,
"learning_rate": 0.0015,
"loss": 2.7567,
"step": 1520
},
{
"epoch": 0.010139316847067498,
"grad_norm": 0.182477667927742,
"learning_rate": 0.001519749835418038,
"loss": 2.7508,
"step": 1540
},
{
"epoch": 0.010270996286639805,
"grad_norm": 0.18245883285999298,
"learning_rate": 0.0015394996708360765,
"loss": 2.7286,
"step": 1560
},
{
"epoch": 0.01040267572621211,
"grad_norm": 0.18001046776771545,
"learning_rate": 0.0015592495062541148,
"loss": 2.7224,
"step": 1580
},
{
"epoch": 0.010534355165784414,
"grad_norm": 0.17572300136089325,
"learning_rate": 0.0015789993416721528,
"loss": 2.7126,
"step": 1600
},
{
"epoch": 0.01066603460535672,
"grad_norm": 0.17919962108135223,
"learning_rate": 0.0015987491770901908,
"loss": 2.7043,
"step": 1620
},
{
"epoch": 0.010797714044929024,
"grad_norm": 0.17204663157463074,
"learning_rate": 0.0016184990125082293,
"loss": 2.6945,
"step": 1640
},
{
"epoch": 0.01092939348450133,
"grad_norm": 0.17742666602134705,
"learning_rate": 0.0016382488479262673,
"loss": 2.6981,
"step": 1660
},
{
"epoch": 0.011061072924073635,
"grad_norm": 0.18275167047977448,
"learning_rate": 0.0016579986833443056,
"loss": 2.6782,
"step": 1680
},
{
"epoch": 0.01119275236364594,
"grad_norm": 0.18246972560882568,
"learning_rate": 0.0016777485187623436,
"loss": 2.6805,
"step": 1700
},
{
"epoch": 0.011324431803218245,
"grad_norm": 0.17320232093334198,
"learning_rate": 0.001697498354180382,
"loss": 2.6698,
"step": 1720
},
{
"epoch": 0.011456111242790551,
"grad_norm": 0.16316188871860504,
"learning_rate": 0.00171724818959842,
"loss": 2.6563,
"step": 1740
},
{
"epoch": 0.011587790682362856,
"grad_norm": 0.17399418354034424,
"learning_rate": 0.001736998025016458,
"loss": 2.6639,
"step": 1760
},
{
"epoch": 0.01171947012193516,
"grad_norm": 0.16352471709251404,
"learning_rate": 0.0017567478604344963,
"loss": 2.6778,
"step": 1780
},
{
"epoch": 0.011851149561507466,
"grad_norm": 0.167058527469635,
"learning_rate": 0.0017764976958525348,
"loss": 2.6616,
"step": 1800
},
{
"epoch": 0.011982829001079772,
"grad_norm": 0.18267591297626495,
"learning_rate": 0.0017962475312705728,
"loss": 2.6714,
"step": 1820
},
{
"epoch": 0.012114508440652077,
"grad_norm": 0.17048963904380798,
"learning_rate": 0.0018159973666886109,
"loss": 2.6543,
"step": 1840
},
{
"epoch": 0.012246187880224382,
"grad_norm": 0.16198118031024933,
"learning_rate": 0.0018357472021066491,
"loss": 2.6529,
"step": 1860
},
{
"epoch": 0.012377867319796686,
"grad_norm": 0.1616767942905426,
"learning_rate": 0.0018554970375246874,
"loss": 2.6387,
"step": 1880
},
{
"epoch": 0.012509546759368993,
"grad_norm": 0.1541590839624405,
"learning_rate": 0.0018752468729427256,
"loss": 2.6181,
"step": 1900
},
{
"epoch": 0.012641226198941298,
"grad_norm": 0.15989308059215546,
"learning_rate": 0.0018949967083607636,
"loss": 2.6226,
"step": 1920
},
{
"epoch": 0.012772905638513602,
"grad_norm": 0.1667192429304123,
"learning_rate": 0.0019147465437788017,
"loss": 2.6192,
"step": 1940
},
{
"epoch": 0.012904585078085907,
"grad_norm": 0.15245971083641052,
"learning_rate": 0.0019344963791968401,
"loss": 2.6103,
"step": 1960
},
{
"epoch": 0.013036264517658214,
"grad_norm": 0.16327407956123352,
"learning_rate": 0.001954246214614878,
"loss": 2.5959,
"step": 1980
},
{
"epoch": 0.013167943957230518,
"grad_norm": 0.1521947681903839,
"learning_rate": 0.001973996050032916,
"loss": 2.5968,
"step": 2000
},
{
"epoch": 0.013167943957230518,
"eval_loss": 2.627993106842041,
"eval_runtime": 67.8897,
"eval_samples_per_second": 14.73,
"eval_steps_per_second": 14.73,
"step": 2000
},
{
"epoch": 0.013299623396802823,
"grad_norm": 0.14737296104431152,
"learning_rate": 0.0019937458854509546,
"loss": 2.5906,
"step": 2020
},
{
"epoch": 0.013431302836375128,
"grad_norm": 0.1449994295835495,
"learning_rate": 0.002013495720868993,
"loss": 2.5751,
"step": 2040
},
{
"epoch": 0.013562982275947433,
"grad_norm": 0.15211527049541473,
"learning_rate": 0.002033245556287031,
"loss": 2.5802,
"step": 2060
},
{
"epoch": 0.01369466171551974,
"grad_norm": 0.1509827822446823,
"learning_rate": 0.002052995391705069,
"loss": 2.5624,
"step": 2080
},
{
"epoch": 0.013826341155092044,
"grad_norm": 0.1424606740474701,
"learning_rate": 0.002072745227123107,
"loss": 2.5616,
"step": 2100
},
{
"epoch": 0.013958020594664349,
"grad_norm": 0.1456785947084427,
"learning_rate": 0.0020924950625411456,
"loss": 2.5614,
"step": 2120
},
{
"epoch": 0.014089700034236654,
"grad_norm": 0.1454639583826065,
"learning_rate": 0.0021122448979591837,
"loss": 2.548,
"step": 2140
},
{
"epoch": 0.01422137947380896,
"grad_norm": 0.15996553003787994,
"learning_rate": 0.0021319947333772217,
"loss": 2.5564,
"step": 2160
},
{
"epoch": 0.014353058913381265,
"grad_norm": 0.14995744824409485,
"learning_rate": 0.0021517445687952597,
"loss": 2.537,
"step": 2180
},
{
"epoch": 0.01448473835295357,
"grad_norm": 0.1442878395318985,
"learning_rate": 0.002171494404213298,
"loss": 2.5322,
"step": 2200
},
{
"epoch": 0.014616417792525874,
"grad_norm": 0.14572259783744812,
"learning_rate": 0.0021912442396313367,
"loss": 2.5248,
"step": 2220
},
{
"epoch": 0.014748097232098181,
"grad_norm": 0.14792700111865997,
"learning_rate": 0.0022109940750493747,
"loss": 2.5214,
"step": 2240
},
{
"epoch": 0.014879776671670486,
"grad_norm": 0.13958069682121277,
"learning_rate": 0.0022307439104674127,
"loss": 2.5081,
"step": 2260
},
{
"epoch": 0.01501145611124279,
"grad_norm": 0.1351982206106186,
"learning_rate": 0.002250493745885451,
"loss": 2.5116,
"step": 2280
},
{
"epoch": 0.015143135550815095,
"grad_norm": 0.14376430213451385,
"learning_rate": 0.002270243581303489,
"loss": 2.4984,
"step": 2300
},
{
"epoch": 0.015274814990387402,
"grad_norm": 0.15098074078559875,
"learning_rate": 0.0022899934167215272,
"loss": 2.4982,
"step": 2320
},
{
"epoch": 0.015406494429959706,
"grad_norm": 0.13247129321098328,
"learning_rate": 0.0023097432521395657,
"loss": 2.4841,
"step": 2340
},
{
"epoch": 0.015538173869532011,
"grad_norm": 0.14014942944049835,
"learning_rate": 0.0023294930875576037,
"loss": 2.4941,
"step": 2360
},
{
"epoch": 0.015669853309104316,
"grad_norm": 0.13669346272945404,
"learning_rate": 0.0023492429229756417,
"loss": 2.5085,
"step": 2380
},
{
"epoch": 0.01580153274867662,
"grad_norm": 0.12908074259757996,
"learning_rate": 0.00236899275839368,
"loss": 2.4982,
"step": 2400
},
{
"epoch": 0.015933212188248926,
"grad_norm": 0.12701626121997833,
"learning_rate": 0.0023887425938117182,
"loss": 2.4868,
"step": 2420
},
{
"epoch": 0.01606489162782123,
"grad_norm": 0.13361623883247375,
"learning_rate": 0.0024084924292297567,
"loss": 2.4894,
"step": 2440
},
{
"epoch": 0.01619657106739354,
"grad_norm": 0.12999138236045837,
"learning_rate": 0.0024282422646477947,
"loss": 2.4742,
"step": 2460
},
{
"epoch": 0.016328250506965843,
"grad_norm": 0.12473666667938232,
"learning_rate": 0.0024479921000658328,
"loss": 2.466,
"step": 2480
},
{
"epoch": 0.016459929946538148,
"grad_norm": 0.12962856888771057,
"learning_rate": 0.002467741935483871,
"loss": 2.4635,
"step": 2500
},
{
"epoch": 0.016591609386110453,
"grad_norm": 0.13669155538082123,
"learning_rate": 0.0024874917709019092,
"loss": 2.4574,
"step": 2520
},
{
"epoch": 0.016723288825682758,
"grad_norm": 0.1261315792798996,
"learning_rate": 0.0025072416063199473,
"loss": 2.4559,
"step": 2540
},
{
"epoch": 0.016854968265255062,
"grad_norm": 0.1260860413312912,
"learning_rate": 0.0025269914417379853,
"loss": 2.4436,
"step": 2560
},
{
"epoch": 0.016986647704827367,
"grad_norm": 0.11925692856311798,
"learning_rate": 0.0025467412771560238,
"loss": 2.4467,
"step": 2580
},
{
"epoch": 0.017118327144399672,
"grad_norm": 0.12199912220239639,
"learning_rate": 0.002566491112574062,
"loss": 2.4395,
"step": 2600
},
{
"epoch": 0.01725000658397198,
"grad_norm": 0.13121625781059265,
"learning_rate": 0.0025862409479921003,
"loss": 2.4364,
"step": 2620
},
{
"epoch": 0.017381686023544285,
"grad_norm": 0.1242750957608223,
"learning_rate": 0.0026059907834101383,
"loss": 2.425,
"step": 2640
},
{
"epoch": 0.01751336546311659,
"grad_norm": 0.11995479464530945,
"learning_rate": 0.0026257406188281767,
"loss": 2.4223,
"step": 2660
},
{
"epoch": 0.017645044902688894,
"grad_norm": 0.11676183342933655,
"learning_rate": 0.0026454904542462148,
"loss": 2.4124,
"step": 2680
},
{
"epoch": 0.0177767243422612,
"grad_norm": 0.11701571941375732,
"learning_rate": 0.002665240289664253,
"loss": 2.4044,
"step": 2700
},
{
"epoch": 0.017908403781833504,
"grad_norm": 0.1141498014330864,
"learning_rate": 0.002684990125082291,
"loss": 2.4086,
"step": 2720
},
{
"epoch": 0.01804008322140581,
"grad_norm": 0.11457623541355133,
"learning_rate": 0.0027047399605003293,
"loss": 2.405,
"step": 2740
},
{
"epoch": 0.018171762660978114,
"grad_norm": 0.11170320957899094,
"learning_rate": 0.0027244897959183673,
"loss": 2.4041,
"step": 2760
},
{
"epoch": 0.018303442100550422,
"grad_norm": 0.11429501324892044,
"learning_rate": 0.0027442396313364053,
"loss": 2.3886,
"step": 2780
},
{
"epoch": 0.018435121540122727,
"grad_norm": 0.11575177311897278,
"learning_rate": 0.002763989466754444,
"loss": 2.3928,
"step": 2800
},
{
"epoch": 0.01856680097969503,
"grad_norm": 0.11174377053976059,
"learning_rate": 0.0027837393021724823,
"loss": 2.3923,
"step": 2820
},
{
"epoch": 0.018698480419267336,
"grad_norm": 0.11565430462360382,
"learning_rate": 0.0028034891375905203,
"loss": 2.3876,
"step": 2840
},
{
"epoch": 0.01883015985883964,
"grad_norm": 0.1113847866654396,
"learning_rate": 0.0028232389730085583,
"loss": 2.3715,
"step": 2860
},
{
"epoch": 0.018961839298411946,
"grad_norm": 0.11279511451721191,
"learning_rate": 0.0028429888084265964,
"loss": 2.3877,
"step": 2880
},
{
"epoch": 0.01909351873798425,
"grad_norm": 0.10945755243301392,
"learning_rate": 0.002862738643844635,
"loss": 2.3713,
"step": 2900
},
{
"epoch": 0.019225198177556555,
"grad_norm": 0.11334076523780823,
"learning_rate": 0.002882488479262673,
"loss": 2.3714,
"step": 2920
},
{
"epoch": 0.01935687761712886,
"grad_norm": 0.11575334519147873,
"learning_rate": 0.002902238314680711,
"loss": 2.3841,
"step": 2940
},
{
"epoch": 0.019488557056701168,
"grad_norm": 0.10688841342926025,
"learning_rate": 0.002921988150098749,
"loss": 2.4039,
"step": 2960
},
{
"epoch": 0.019620236496273473,
"grad_norm": 0.10941021889448166,
"learning_rate": 0.0029417379855167874,
"loss": 2.4104,
"step": 2980
},
{
"epoch": 0.019751915935845778,
"grad_norm": 0.10736847668886185,
"learning_rate": 0.002961487820934826,
"loss": 2.4152,
"step": 3000
},
{
"epoch": 0.019751915935845778,
"eval_loss": 2.4375340938568115,
"eval_runtime": 68.5796,
"eval_samples_per_second": 14.582,
"eval_steps_per_second": 14.582,
"step": 3000
},
{
"epoch": 0.019883595375418082,
"grad_norm": 0.10122061520814896,
"learning_rate": 0.002981237656352864,
"loss": 2.4102,
"step": 3020
},
{
"epoch": 0.020015274814990387,
"grad_norm": 0.10470600426197052,
"learning_rate": 0.002999999999665892,
"loss": 2.4042,
"step": 3040
},
{
"epoch": 0.020146954254562692,
"grad_norm": 0.10254276543855667,
"learning_rate": 0.002999999852658443,
"loss": 2.4062,
"step": 3060
},
{
"epoch": 0.020278633694134997,
"grad_norm": 0.10125599801540375,
"learning_rate": 0.0029999994383647483,
"loss": 2.3965,
"step": 3080
},
{
"epoch": 0.0204103131337073,
"grad_norm": 0.10337845981121063,
"learning_rate": 0.0029999987567848824,
"loss": 2.3924,
"step": 3100
},
{
"epoch": 0.02054199257327961,
"grad_norm": 0.09914848208427429,
"learning_rate": 0.002999997807918967,
"loss": 2.3903,
"step": 3120
},
{
"epoch": 0.020673672012851915,
"grad_norm": 0.10522714257240295,
"learning_rate": 0.0029999965917671696,
"loss": 2.3765,
"step": 3140
},
{
"epoch": 0.02080535145242422,
"grad_norm": 0.10708487033843994,
"learning_rate": 0.0029999951083297086,
"loss": 2.3739,
"step": 3160
},
{
"epoch": 0.020937030891996524,
"grad_norm": 0.09805380553007126,
"learning_rate": 0.002999993357606847,
"loss": 2.3596,
"step": 3180
},
{
"epoch": 0.02106871033156883,
"grad_norm": 0.09819849580526352,
"learning_rate": 0.002999991339598898,
"loss": 2.3597,
"step": 3200
},
{
"epoch": 0.021200389771141134,
"grad_norm": 0.09890013933181763,
"learning_rate": 0.0029999890543062208,
"loss": 2.3504,
"step": 3220
},
{
"epoch": 0.02133206921071344,
"grad_norm": 0.09736858308315277,
"learning_rate": 0.002999986501729222,
"loss": 2.3472,
"step": 3240
},
{
"epoch": 0.021463748650285743,
"grad_norm": 0.09881199896335602,
"learning_rate": 0.002999983681868357,
"loss": 2.3522,
"step": 3260
},
{
"epoch": 0.021595428089858048,
"grad_norm": 0.09606959670782089,
"learning_rate": 0.0029999805947241278,
"loss": 2.3455,
"step": 3280
},
{
"epoch": 0.021727107529430356,
"grad_norm": 0.09520818293094635,
"learning_rate": 0.0029999772402970856,
"loss": 2.3422,
"step": 3300
},
{
"epoch": 0.02185878696900266,
"grad_norm": 0.09379695355892181,
"learning_rate": 0.0029999736185878268,
"loss": 2.3387,
"step": 3320
},
{
"epoch": 0.021990466408574966,
"grad_norm": 0.0959760919213295,
"learning_rate": 0.0029999697295969977,
"loss": 2.3281,
"step": 3340
},
{
"epoch": 0.02212214584814727,
"grad_norm": 0.0942387580871582,
"learning_rate": 0.002999965573325291,
"loss": 2.3259,
"step": 3360
},
{
"epoch": 0.022253825287719575,
"grad_norm": 0.09221373498439789,
"learning_rate": 0.002999961149773447,
"loss": 2.3186,
"step": 3380
},
{
"epoch": 0.02238550472729188,
"grad_norm": 0.08974644541740417,
"learning_rate": 0.0029999564589422542,
"loss": 2.3115,
"step": 3400
},
{
"epoch": 0.022517184166864185,
"grad_norm": 0.09186951071023941,
"learning_rate": 0.0029999515008325484,
"loss": 2.3165,
"step": 3420
},
{
"epoch": 0.02264886360643649,
"grad_norm": 0.08975733816623688,
"learning_rate": 0.002999946275445213,
"loss": 2.3027,
"step": 3440
},
{
"epoch": 0.022780543046008798,
"grad_norm": 0.08940092474222183,
"learning_rate": 0.0029999407827811797,
"loss": 2.3092,
"step": 3460
},
{
"epoch": 0.022912222485581103,
"grad_norm": 0.08854611217975616,
"learning_rate": 0.0029999350228414262,
"loss": 2.3091,
"step": 3480
},
{
"epoch": 0.023043901925153407,
"grad_norm": 0.10679975897073746,
"learning_rate": 0.0029999289956269804,
"loss": 2.2952,
"step": 3500
},
{
"epoch": 0.023175581364725712,
"grad_norm": 0.08808766305446625,
"learning_rate": 0.002999922701138914,
"loss": 2.294,
"step": 3520
},
{
"epoch": 0.023307260804298017,
"grad_norm": 0.0875706821680069,
"learning_rate": 0.0029999161393783513,
"loss": 2.2998,
"step": 3540
},
{
"epoch": 0.02343894024387032,
"grad_norm": 0.0930817723274231,
"learning_rate": 0.0029999093103464593,
"loss": 2.302,
"step": 3560
},
{
"epoch": 0.023570619683442626,
"grad_norm": 0.08741556853055954,
"learning_rate": 0.0029999022140444562,
"loss": 2.2977,
"step": 3580
},
{
"epoch": 0.02370229912301493,
"grad_norm": 0.08739639818668365,
"learning_rate": 0.002999894850473606,
"loss": 2.2979,
"step": 3600
},
{
"epoch": 0.023833978562587236,
"grad_norm": 0.08801335841417313,
"learning_rate": 0.0029998872196352207,
"loss": 2.2972,
"step": 3620
},
{
"epoch": 0.023965658002159544,
"grad_norm": 0.08532336354255676,
"learning_rate": 0.0029998793215306606,
"loss": 2.2853,
"step": 3640
},
{
"epoch": 0.02409733744173185,
"grad_norm": 0.08780607581138611,
"learning_rate": 0.0029998711561613324,
"loss": 2.2747,
"step": 3660
},
{
"epoch": 0.024229016881304154,
"grad_norm": 0.08572492003440857,
"learning_rate": 0.0029998627235286917,
"loss": 2.2817,
"step": 3680
},
{
"epoch": 0.02436069632087646,
"grad_norm": 0.0868530198931694,
"learning_rate": 0.0029998540236342405,
"loss": 2.2666,
"step": 3700
},
{
"epoch": 0.024492375760448763,
"grad_norm": 0.0859028622508049,
"learning_rate": 0.00299984505647953,
"loss": 2.2736,
"step": 3720
},
{
"epoch": 0.024624055200021068,
"grad_norm": 0.08333039283752441,
"learning_rate": 0.0029998358220661566,
"loss": 2.264,
"step": 3740
},
{
"epoch": 0.024755734639593373,
"grad_norm": 0.08496104925870895,
"learning_rate": 0.002999826320395767,
"loss": 2.2508,
"step": 3760
},
{
"epoch": 0.024887414079165678,
"grad_norm": 0.08279310911893845,
"learning_rate": 0.002999816551470054,
"loss": 2.2428,
"step": 3780
},
{
"epoch": 0.025019093518737986,
"grad_norm": 0.08103163540363312,
"learning_rate": 0.0029998065152907582,
"loss": 2.2534,
"step": 3800
},
{
"epoch": 0.02515077295831029,
"grad_norm": 0.08208036422729492,
"learning_rate": 0.002999796211859668,
"loss": 2.244,
"step": 3820
},
{
"epoch": 0.025282452397882595,
"grad_norm": 0.08271029591560364,
"learning_rate": 0.0029997856411786194,
"loss": 2.2451,
"step": 3840
},
{
"epoch": 0.0254141318374549,
"grad_norm": 0.08439147472381592,
"learning_rate": 0.002999774803249496,
"loss": 2.2411,
"step": 3860
},
{
"epoch": 0.025545811277027205,
"grad_norm": 0.08189237862825394,
"learning_rate": 0.0029997636980742294,
"loss": 2.2461,
"step": 3880
},
{
"epoch": 0.02567749071659951,
"grad_norm": 0.08077215403318405,
"learning_rate": 0.002999752325654798,
"loss": 2.2334,
"step": 3900
},
{
"epoch": 0.025809170156171814,
"grad_norm": 0.07819052785634995,
"learning_rate": 0.002999740685993228,
"loss": 2.2288,
"step": 3920
},
{
"epoch": 0.02594084959574412,
"grad_norm": 0.08109986782073975,
"learning_rate": 0.002999728779091594,
"loss": 2.2333,
"step": 3940
},
{
"epoch": 0.026072529035316427,
"grad_norm": 0.0791846290230751,
"learning_rate": 0.0029997166049520172,
"loss": 2.2197,
"step": 3960
},
{
"epoch": 0.026204208474888732,
"grad_norm": 0.08189737796783447,
"learning_rate": 0.0029997041635766676,
"loss": 2.2204,
"step": 3980
},
{
"epoch": 0.026335887914461037,
"grad_norm": 0.08211075514554977,
"learning_rate": 0.0029996914549677615,
"loss": 2.2199,
"step": 4000
},
{
"epoch": 0.026335887914461037,
"eval_loss": 2.2871885299682617,
"eval_runtime": 67.7873,
"eval_samples_per_second": 14.752,
"eval_steps_per_second": 14.752,
"step": 4000
},
{
"epoch": 0.02646756735403334,
"grad_norm": 0.08011506497859955,
"learning_rate": 0.0029996784791275636,
"loss": 2.211,
"step": 4020
},
{
"epoch": 0.026599246793605646,
"grad_norm": 0.08271001279354095,
"learning_rate": 0.0029996652360583863,
"loss": 2.2097,
"step": 4040
},
{
"epoch": 0.02673092623317795,
"grad_norm": 0.08106506615877151,
"learning_rate": 0.0029996517257625892,
"loss": 2.2117,
"step": 4060
},
{
"epoch": 0.026862605672750256,
"grad_norm": 0.08120162785053253,
"learning_rate": 0.0029996379482425803,
"loss": 2.2011,
"step": 4080
},
{
"epoch": 0.02699428511232256,
"grad_norm": 0.07838305830955505,
"learning_rate": 0.002999623903500814,
"loss": 2.209,
"step": 4100
},
{
"epoch": 0.027125964551894866,
"grad_norm": 0.07733200490474701,
"learning_rate": 0.0029996095915397927,
"loss": 2.2049,
"step": 4120
},
{
"epoch": 0.027257643991467174,
"grad_norm": 0.08035876601934433,
"learning_rate": 0.002999595012362067,
"loss": 2.2351,
"step": 4140
},
{
"epoch": 0.02738932343103948,
"grad_norm": 0.07693365216255188,
"learning_rate": 0.0029995801659702353,
"loss": 2.2437,
"step": 4160
},
{
"epoch": 0.027521002870611783,
"grad_norm": 0.07832279056310654,
"learning_rate": 0.002999565052366942,
"loss": 2.2516,
"step": 4180
},
{
"epoch": 0.027652682310184088,
"grad_norm": 0.07737457007169724,
"learning_rate": 0.0029995496715548814,
"loss": 2.2528,
"step": 4200
},
{
"epoch": 0.027784361749756393,
"grad_norm": 0.07880548387765884,
"learning_rate": 0.0029995340235367935,
"loss": 2.2481,
"step": 4220
},
{
"epoch": 0.027916041189328698,
"grad_norm": 0.07748763263225555,
"learning_rate": 0.0029995181083154665,
"loss": 2.2366,
"step": 4240
},
{
"epoch": 0.028047720628901002,
"grad_norm": 0.07669378817081451,
"learning_rate": 0.0029995019258937366,
"loss": 2.2354,
"step": 4260
},
{
"epoch": 0.028179400068473307,
"grad_norm": 0.07612152397632599,
"learning_rate": 0.0029994854762744874,
"loss": 2.2306,
"step": 4280
},
{
"epoch": 0.028311079508045615,
"grad_norm": 0.07380878925323486,
"learning_rate": 0.0029994687594606505,
"loss": 2.2222,
"step": 4300
},
{
"epoch": 0.02844275894761792,
"grad_norm": 0.08108644932508469,
"learning_rate": 0.0029994517754552037,
"loss": 2.2188,
"step": 4320
},
{
"epoch": 0.028574438387190225,
"grad_norm": 0.07742933928966522,
"learning_rate": 0.002999434524261174,
"loss": 2.2244,
"step": 4340
},
{
"epoch": 0.02870611782676253,
"grad_norm": 0.07378648966550827,
"learning_rate": 0.0029994170058816358,
"loss": 2.2179,
"step": 4360
},
{
"epoch": 0.028837797266334834,
"grad_norm": 0.07612361758947372,
"learning_rate": 0.0029993992203197098,
"loss": 2.215,
"step": 4380
},
{
"epoch": 0.02896947670590714,
"grad_norm": 0.07602405548095703,
"learning_rate": 0.0029993811675785654,
"loss": 2.2174,
"step": 4400
},
{
"epoch": 0.029101156145479444,
"grad_norm": 0.07372742891311646,
"learning_rate": 0.00299936284766142,
"loss": 2.2115,
"step": 4420
},
{
"epoch": 0.02923283558505175,
"grad_norm": 0.07210436463356018,
"learning_rate": 0.002999344260571538,
"loss": 2.2031,
"step": 4440
},
{
"epoch": 0.029364515024624054,
"grad_norm": 0.07500762492418289,
"learning_rate": 0.002999325406312231,
"loss": 2.2029,
"step": 4460
},
{
"epoch": 0.029496194464196362,
"grad_norm": 0.0756341964006424,
"learning_rate": 0.0029993062848868582,
"loss": 2.2036,
"step": 4480
},
{
"epoch": 0.029627873903768667,
"grad_norm": 0.07349260151386261,
"learning_rate": 0.0029992868962988284,
"loss": 2.199,
"step": 4500
},
{
"epoch": 0.02975955334334097,
"grad_norm": 0.07115154713392258,
"learning_rate": 0.002999267240551595,
"loss": 2.1924,
"step": 4520
},
{
"epoch": 0.029891232782913276,
"grad_norm": 0.07597554475069046,
"learning_rate": 0.0029992473176486613,
"loss": 2.2,
"step": 4540
},
{
"epoch": 0.03002291222248558,
"grad_norm": 0.07525033503770828,
"learning_rate": 0.0029992271275935773,
"loss": 2.19,
"step": 4560
},
{
"epoch": 0.030154591662057886,
"grad_norm": 0.07225248217582703,
"learning_rate": 0.0029992066703899405,
"loss": 2.1817,
"step": 4580
},
{
"epoch": 0.03028627110163019,
"grad_norm": 0.07293014973402023,
"learning_rate": 0.002999185946041396,
"loss": 2.1886,
"step": 4600
},
{
"epoch": 0.030417950541202495,
"grad_norm": 0.07140370458364487,
"learning_rate": 0.002999164954551637,
"loss": 2.1811,
"step": 4620
},
{
"epoch": 0.030549629980774803,
"grad_norm": 0.0731213241815567,
"learning_rate": 0.0029991436959244037,
"loss": 2.1827,
"step": 4640
},
{
"epoch": 0.030681309420347108,
"grad_norm": 0.06939541548490524,
"learning_rate": 0.0029991221701634843,
"loss": 2.1807,
"step": 4660
},
{
"epoch": 0.030812988859919413,
"grad_norm": 0.0718071386218071,
"learning_rate": 0.0029991003772727146,
"loss": 2.1807,
"step": 4680
},
{
"epoch": 0.030944668299491718,
"grad_norm": 0.0721597746014595,
"learning_rate": 0.002999078317255978,
"loss": 2.1679,
"step": 4700
},
{
"epoch": 0.031076347739064022,
"grad_norm": 0.388390451669693,
"learning_rate": 0.0029990559901172053,
"loss": 2.4076,
"step": 4720
},
{
"epoch": 0.031208027178636327,
"grad_norm": 0.12360863387584686,
"learning_rate": 0.0029990333958603748,
"loss": 2.7131,
"step": 4740
},
{
"epoch": 0.03133970661820863,
"grad_norm": 0.088360495865345,
"learning_rate": 0.002999010534489513,
"loss": 2.425,
"step": 4760
},
{
"epoch": 0.03147138605778094,
"grad_norm": 0.07668942958116531,
"learning_rate": 0.002998987406008693,
"loss": 2.3163,
"step": 4780
},
{
"epoch": 0.03160306549735324,
"grad_norm": 0.07627064734697342,
"learning_rate": 0.0029989640104220363,
"loss": 2.2667,
"step": 4800
},
{
"epoch": 0.031734744936925546,
"grad_norm": 0.07259105890989304,
"learning_rate": 0.0029989403477337123,
"loss": 2.2479,
"step": 4820
},
{
"epoch": 0.03186642437649785,
"grad_norm": 0.06848350912332535,
"learning_rate": 0.0029989164179479366,
"loss": 2.2312,
"step": 4840
},
{
"epoch": 0.031998103816070156,
"grad_norm": 0.0695989802479744,
"learning_rate": 0.0029988922210689743,
"loss": 2.2274,
"step": 4860
},
{
"epoch": 0.03212978325564246,
"grad_norm": 0.07058060169219971,
"learning_rate": 0.002998867757101136,
"loss": 2.2065,
"step": 4880
},
{
"epoch": 0.03226146269521477,
"grad_norm": 0.07192632555961609,
"learning_rate": 0.0029988430260487822,
"loss": 2.1976,
"step": 4900
},
{
"epoch": 0.03239314213478708,
"grad_norm": 0.07093453407287598,
"learning_rate": 0.002998818027916318,
"loss": 2.1925,
"step": 4920
},
{
"epoch": 0.03252482157435938,
"grad_norm": 0.0686832144856453,
"learning_rate": 0.002998792762708199,
"loss": 2.1805,
"step": 4940
},
{
"epoch": 0.03265650101393169,
"grad_norm": 0.06718004494905472,
"learning_rate": 0.0029987672304289275,
"loss": 2.177,
"step": 4960
},
{
"epoch": 0.03278818045350399,
"grad_norm": 0.07362579554319382,
"learning_rate": 0.0029987414310830526,
"loss": 2.173,
"step": 4980
},
{
"epoch": 0.032919859893076296,
"grad_norm": 0.06656539440155029,
"learning_rate": 0.0029987153646751715,
"loss": 2.1698,
"step": 5000
},
{
"epoch": 0.032919859893076296,
"eval_loss": 2.136354446411133,
"eval_runtime": 67.5662,
"eval_samples_per_second": 14.8,
"eval_steps_per_second": 14.8,
"step": 5000
},
{
"epoch": 0.0330515393326486,
"grad_norm": 0.06965313106775284,
"learning_rate": 0.0029986890312099284,
"loss": 2.1551,
"step": 5020
},
{
"epoch": 0.033183218772220906,
"grad_norm": 0.06893343478441238,
"learning_rate": 0.0029986624306920177,
"loss": 2.1559,
"step": 5040
},
{
"epoch": 0.03331489821179321,
"grad_norm": 0.06808198988437653,
"learning_rate": 0.0029986355631261767,
"loss": 2.1516,
"step": 5060
},
{
"epoch": 0.033446577651365515,
"grad_norm": 0.06501699984073639,
"learning_rate": 0.002998608428517195,
"loss": 2.1496,
"step": 5080
},
{
"epoch": 0.03357825709093782,
"grad_norm": 0.0687108114361763,
"learning_rate": 0.002998581026869907,
"loss": 2.1428,
"step": 5100
},
{
"epoch": 0.033709936530510125,
"grad_norm": 0.06481294333934784,
"learning_rate": 0.0029985533581891955,
"loss": 2.1408,
"step": 5120
},
{
"epoch": 0.03384161597008243,
"grad_norm": 0.06615699827671051,
"learning_rate": 0.002998525422479991,
"loss": 2.1389,
"step": 5140
},
{
"epoch": 0.033973295409654734,
"grad_norm": 0.06763967871665955,
"learning_rate": 0.00299849721974727,
"loss": 2.1272,
"step": 5160
},
{
"epoch": 0.03410497484922704,
"grad_norm": 0.0660347044467926,
"learning_rate": 0.0029984687499960603,
"loss": 2.1297,
"step": 5180
},
{
"epoch": 0.034236654288799344,
"grad_norm": 0.06650801748037338,
"learning_rate": 0.002998440013231433,
"loss": 2.131,
"step": 5200
},
{
"epoch": 0.03436833372837165,
"grad_norm": 0.06661241501569748,
"learning_rate": 0.0029984110094585102,
"loss": 2.1246,
"step": 5220
},
{
"epoch": 0.03450001316794396,
"grad_norm": 0.06411544978618622,
"learning_rate": 0.0029983817386824586,
"loss": 2.1241,
"step": 5240
},
{
"epoch": 0.034631692607516265,
"grad_norm": 0.06469565629959106,
"learning_rate": 0.0029983522009084953,
"loss": 2.1161,
"step": 5260
},
{
"epoch": 0.03476337204708857,
"grad_norm": 0.06469576805830002,
"learning_rate": 0.0029983223961418835,
"loss": 2.121,
"step": 5280
},
{
"epoch": 0.034895051486660875,
"grad_norm": 0.06342877447605133,
"learning_rate": 0.002998292324387933,
"loss": 2.1244,
"step": 5300
},
{
"epoch": 0.03502673092623318,
"grad_norm": 0.06592860817909241,
"learning_rate": 0.0029982619856520035,
"loss": 2.1312,
"step": 5320
},
{
"epoch": 0.035158410365805484,
"grad_norm": 0.06745469570159912,
"learning_rate": 0.0029982313799395005,
"loss": 2.1259,
"step": 5340
},
{
"epoch": 0.03529008980537779,
"grad_norm": 0.06721679121255875,
"learning_rate": 0.0029982005072558774,
"loss": 2.1212,
"step": 5360
},
{
"epoch": 0.035421769244950094,
"grad_norm": 0.0677921324968338,
"learning_rate": 0.0029981693676066367,
"loss": 2.1187,
"step": 5380
},
{
"epoch": 0.0355534486845224,
"grad_norm": 0.06510468572378159,
"learning_rate": 0.0029981379609973257,
"loss": 2.1186,
"step": 5400
},
{
"epoch": 0.0356851281240947,
"grad_norm": 0.06507667899131775,
"learning_rate": 0.002998106287433542,
"loss": 2.1085,
"step": 5420
},
{
"epoch": 0.03581680756366701,
"grad_norm": 0.06307834386825562,
"learning_rate": 0.0029980743469209285,
"loss": 2.1086,
"step": 5440
},
{
"epoch": 0.03594848700323931,
"grad_norm": 0.06396503001451492,
"learning_rate": 0.0029980421394651775,
"loss": 2.1012,
"step": 5460
},
{
"epoch": 0.03608016644281162,
"grad_norm": 0.0639200434088707,
"learning_rate": 0.0029980096650720277,
"loss": 2.1048,
"step": 5480
},
{
"epoch": 0.03621184588238392,
"grad_norm": 0.06461615860462189,
"learning_rate": 0.0029979769237472656,
"loss": 2.098,
"step": 5500
},
{
"epoch": 0.03634352532195623,
"grad_norm": 0.06527513265609741,
"learning_rate": 0.0029979439154967256,
"loss": 2.0921,
"step": 5520
},
{
"epoch": 0.03647520476152853,
"grad_norm": 0.06093462184071541,
"learning_rate": 0.0029979106403262897,
"loss": 2.0834,
"step": 5540
},
{
"epoch": 0.036606884201100844,
"grad_norm": 0.06476835161447525,
"learning_rate": 0.002997877098241887,
"loss": 2.0851,
"step": 5560
},
{
"epoch": 0.03673856364067315,
"grad_norm": 0.06311192363500595,
"learning_rate": 0.002997843289249494,
"loss": 2.0799,
"step": 5580
},
{
"epoch": 0.03687024308024545,
"grad_norm": 0.06339168548583984,
"learning_rate": 0.002997809213355136,
"loss": 2.0858,
"step": 5600
},
{
"epoch": 0.03700192251981776,
"grad_norm": 0.06146325170993805,
"learning_rate": 0.002997774870564884,
"loss": 2.0948,
"step": 5620
},
{
"epoch": 0.03713360195939006,
"grad_norm": 0.06187060475349426,
"learning_rate": 0.0029977402608848585,
"loss": 2.0822,
"step": 5640
},
{
"epoch": 0.03726528139896237,
"grad_norm": 0.06805236637592316,
"learning_rate": 0.0029977053843212266,
"loss": 2.0759,
"step": 5660
},
{
"epoch": 0.03739696083853467,
"grad_norm": 0.06448160111904144,
"learning_rate": 0.002997670240880202,
"loss": 2.08,
"step": 5680
},
{
"epoch": 0.03752864027810698,
"grad_norm": 0.06372448801994324,
"learning_rate": 0.002997634830568048,
"loss": 2.0823,
"step": 5700
},
{
"epoch": 0.03766031971767928,
"grad_norm": 0.061139971017837524,
"learning_rate": 0.0029975991533910734,
"loss": 2.0742,
"step": 5720
},
{
"epoch": 0.037791999157251586,
"grad_norm": 0.06403601914644241,
"learning_rate": 0.0029975632093556365,
"loss": 2.0664,
"step": 5740
},
{
"epoch": 0.03792367859682389,
"grad_norm": 0.06160760670900345,
"learning_rate": 0.002997526998468142,
"loss": 2.0591,
"step": 5760
},
{
"epoch": 0.038055358036396196,
"grad_norm": 0.06119397282600403,
"learning_rate": 0.0029974905207350417,
"loss": 2.0637,
"step": 5780
},
{
"epoch": 0.0381870374759685,
"grad_norm": 0.062456753104925156,
"learning_rate": 0.0029974537761628364,
"loss": 2.0611,
"step": 5800
},
{
"epoch": 0.038318716915540806,
"grad_norm": 0.06182549521327019,
"learning_rate": 0.002997416764758073,
"loss": 2.0619,
"step": 5820
},
{
"epoch": 0.03845039635511311,
"grad_norm": 0.06361284852027893,
"learning_rate": 0.002997379486527347,
"loss": 2.054,
"step": 5840
},
{
"epoch": 0.038582075794685415,
"grad_norm": 0.06169150397181511,
"learning_rate": 0.0029973419414773017,
"loss": 2.058,
"step": 5860
},
{
"epoch": 0.03871375523425772,
"grad_norm": 0.06227455288171768,
"learning_rate": 0.002997304129614625,
"loss": 2.0513,
"step": 5880
},
{
"epoch": 0.03884543467383003,
"grad_norm": 0.06137228012084961,
"learning_rate": 0.0029972660509460574,
"loss": 2.0706,
"step": 5900
},
{
"epoch": 0.038977114113402336,
"grad_norm": 0.06067802384495735,
"learning_rate": 0.0029972277054783826,
"loss": 2.0988,
"step": 5920
},
{
"epoch": 0.03910879355297464,
"grad_norm": 0.062081821262836456,
"learning_rate": 0.0029971890932184338,
"loss": 2.1072,
"step": 5940
},
{
"epoch": 0.039240472992546946,
"grad_norm": 0.058524634689092636,
"learning_rate": 0.0029971502141730912,
"loss": 2.112,
"step": 5960
},
{
"epoch": 0.03937215243211925,
"grad_norm": 0.06115134805440903,
"learning_rate": 0.0029971110683492826,
"loss": 2.1138,
"step": 5980
},
{
"epoch": 0.039503831871691555,
"grad_norm": 0.05962108075618744,
"learning_rate": 0.0029970716557539837,
"loss": 2.1112,
"step": 6000
},
{
"epoch": 0.039503831871691555,
"eval_loss": 2.0984599590301514,
"eval_runtime": 67.374,
"eval_samples_per_second": 14.843,
"eval_steps_per_second": 14.843,
"step": 6000
},
{
"epoch": 0.03963551131126386,
"grad_norm": 0.06020989269018173,
"learning_rate": 0.0029970319763942175,
"loss": 2.1038,
"step": 6020
},
{
"epoch": 0.039767190750836165,
"grad_norm": 0.059578102082014084,
"learning_rate": 0.0029969920302770543,
"loss": 2.0974,
"step": 6040
},
{
"epoch": 0.03989887019040847,
"grad_norm": 0.05818217247724533,
"learning_rate": 0.002996951817409612,
"loss": 2.1037,
"step": 6060
},
{
"epoch": 0.040030549629980774,
"grad_norm": 0.05842572823166847,
"learning_rate": 0.0029969113377990566,
"loss": 2.0998,
"step": 6080
},
{
"epoch": 0.04016222906955308,
"grad_norm": 0.057952892035245895,
"learning_rate": 0.002996870591452601,
"loss": 2.1024,
"step": 6100
},
{
"epoch": 0.040293908509125384,
"grad_norm": 0.0585886612534523,
"learning_rate": 0.0029968295783775055,
"loss": 2.0989,
"step": 6120
},
{
"epoch": 0.04042558794869769,
"grad_norm": 0.061875827610492706,
"learning_rate": 0.0029967882985810785,
"loss": 2.0848,
"step": 6140
},
{
"epoch": 0.040557267388269994,
"grad_norm": 0.059371497482061386,
"learning_rate": 0.002996746752070676,
"loss": 2.0865,
"step": 6160
},
{
"epoch": 0.0406889468278423,
"grad_norm": 0.06270122528076172,
"learning_rate": 0.002996704938853701,
"loss": 2.0847,
"step": 6180
},
{
"epoch": 0.0408206262674146,
"grad_norm": 0.05946968123316765,
"learning_rate": 0.002996662858937604,
"loss": 2.0773,
"step": 6200
},
{
"epoch": 0.04095230570698691,
"grad_norm": 0.05964416265487671,
"learning_rate": 0.002996620512329883,
"loss": 2.0827,
"step": 6220
},
{
"epoch": 0.04108398514655922,
"grad_norm": 0.059607379138469696,
"learning_rate": 0.0029965778990380847,
"loss": 2.0802,
"step": 6240
},
{
"epoch": 0.041215664586131524,
"grad_norm": 0.059771690517663956,
"learning_rate": 0.0029965350190698016,
"loss": 2.0753,
"step": 6260
},
{
"epoch": 0.04134734402570383,
"grad_norm": 0.05873079225420952,
"learning_rate": 0.002996491872432675,
"loss": 2.0742,
"step": 6280
},
{
"epoch": 0.041479023465276134,
"grad_norm": 0.05816845968365669,
"learning_rate": 0.0029964484591343933,
"loss": 2.0689,
"step": 6300
},
{
"epoch": 0.04161070290484844,
"grad_norm": 0.057672835886478424,
"learning_rate": 0.002996404779182692,
"loss": 2.0648,
"step": 6320
},
{
"epoch": 0.04174238234442074,
"grad_norm": 0.06043649837374687,
"learning_rate": 0.0029963608325853544,
"loss": 2.0719,
"step": 6340
},
{
"epoch": 0.04187406178399305,
"grad_norm": 0.05902590975165367,
"learning_rate": 0.0029963166193502115,
"loss": 2.0662,
"step": 6360
},
{
"epoch": 0.04200574122356535,
"grad_norm": 0.061324600130319595,
"learning_rate": 0.002996272139485142,
"loss": 2.0672,
"step": 6380
},
{
"epoch": 0.04213742066313766,
"grad_norm": 0.05997491627931595,
"learning_rate": 0.002996227392998071,
"loss": 2.0733,
"step": 6400
},
{
"epoch": 0.04226910010270996,
"grad_norm": 0.0597202442586422,
"learning_rate": 0.0029961823798969733,
"loss": 2.062,
"step": 6420
},
{
"epoch": 0.04240077954228227,
"grad_norm": 0.10704315453767776,
"learning_rate": 0.002996137100189868,
"loss": 2.0669,
"step": 6440
},
{
"epoch": 0.04253245898185457,
"grad_norm": 0.056581802666187286,
"learning_rate": 0.0029960915538848254,
"loss": 2.0585,
"step": 6460
},
{
"epoch": 0.04266413842142688,
"grad_norm": 0.0565234012901783,
"learning_rate": 0.00299604574098996,
"loss": 2.0554,
"step": 6480
},
{
"epoch": 0.04279581786099918,
"grad_norm": 0.056596871465444565,
"learning_rate": 0.0029959996615134357,
"loss": 2.077,
"step": 6500
},
{
"epoch": 0.042927497300571486,
"grad_norm": 0.05787625536322594,
"learning_rate": 0.002995953315463464,
"loss": 2.0741,
"step": 6520
},
{
"epoch": 0.04305917674014379,
"grad_norm": 0.059064172208309174,
"learning_rate": 0.002995906702848302,
"loss": 2.0792,
"step": 6540
},
{
"epoch": 0.043190856179716096,
"grad_norm": 0.057197242975234985,
"learning_rate": 0.0029958598236762574,
"loss": 2.0702,
"step": 6560
},
{
"epoch": 0.04332253561928841,
"grad_norm": 0.05579278990626335,
"learning_rate": 0.002995812677955683,
"loss": 2.0677,
"step": 6580
},
{
"epoch": 0.04345421505886071,
"grad_norm": 0.05777699500322342,
"learning_rate": 0.0029957652656949787,
"loss": 2.0649,
"step": 6600
},
{
"epoch": 0.04358589449843302,
"grad_norm": 0.05634402483701706,
"learning_rate": 0.002995717586902594,
"loss": 2.0681,
"step": 6620
},
{
"epoch": 0.04371757393800532,
"grad_norm": 0.05572090670466423,
"learning_rate": 0.0029956696415870242,
"loss": 2.0587,
"step": 6640
},
{
"epoch": 0.04384925337757763,
"grad_norm": 0.05806443840265274,
"learning_rate": 0.0029956214297568134,
"loss": 2.0555,
"step": 6660
},
{
"epoch": 0.04398093281714993,
"grad_norm": 0.05726337805390358,
"learning_rate": 0.0029955729514205523,
"loss": 2.0474,
"step": 6680
},
{
"epoch": 0.044112612256722236,
"grad_norm": 0.05729576200246811,
"learning_rate": 0.0029955242065868794,
"loss": 2.0489,
"step": 6700
},
{
"epoch": 0.04424429169629454,
"grad_norm": 0.06136414781212807,
"learning_rate": 0.0029954751952644795,
"loss": 2.0509,
"step": 6720
},
{
"epoch": 0.044375971135866846,
"grad_norm": 0.058006297796964645,
"learning_rate": 0.0029954259174620875,
"loss": 2.0515,
"step": 6740
},
{
"epoch": 0.04450765057543915,
"grad_norm": 0.05813615396618843,
"learning_rate": 0.0029953763731884833,
"loss": 2.048,
"step": 6760
},
{
"epoch": 0.044639330015011455,
"grad_norm": 0.05697380378842354,
"learning_rate": 0.0029953265624524956,
"loss": 2.0433,
"step": 6780
},
{
"epoch": 0.04477100945458376,
"grad_norm": 0.05840064957737923,
"learning_rate": 0.002995276485263,
"loss": 2.0405,
"step": 6800
},
{
"epoch": 0.044902688894156065,
"grad_norm": 0.05951813980937004,
"learning_rate": 0.00299522614162892,
"loss": 2.0418,
"step": 6820
},
{
"epoch": 0.04503436833372837,
"grad_norm": 0.05788157880306244,
"learning_rate": 0.0029951755315592264,
"loss": 2.0378,
"step": 6840
},
{
"epoch": 0.045166047773300674,
"grad_norm": 0.05446796864271164,
"learning_rate": 0.002995124655062937,
"loss": 2.0412,
"step": 6860
},
{
"epoch": 0.04529772721287298,
"grad_norm": 0.05822540074586868,
"learning_rate": 0.002995073512149118,
"loss": 2.0357,
"step": 6880
},
{
"epoch": 0.045429406652445284,
"grad_norm": 0.0586545467376709,
"learning_rate": 0.002995022102826883,
"loss": 2.0284,
"step": 6900
},
{
"epoch": 0.045561086092017596,
"grad_norm": 0.056676048785448074,
"learning_rate": 0.0029949704271053914,
"loss": 2.0363,
"step": 6920
},
{
"epoch": 0.0456927655315899,
"grad_norm": 0.0642879530787468,
"learning_rate": 0.0029949184849938524,
"loss": 2.0271,
"step": 6940
},
{
"epoch": 0.045824444971162205,
"grad_norm": 0.054941147565841675,
"learning_rate": 0.002994866276501521,
"loss": 2.0297,
"step": 6960
},
{
"epoch": 0.04595612441073451,
"grad_norm": 0.057689156383275986,
"learning_rate": 0.0029948138016377005,
"loss": 2.032,
"step": 6980
},
{
"epoch": 0.046087803850306815,
"grad_norm": 0.05917928367853165,
"learning_rate": 0.0029947610604117423,
"loss": 2.0272,
"step": 7000
},
{
"epoch": 0.046087803850306815,
"eval_loss": 1.9085378646850586,
"eval_runtime": 68.9073,
"eval_samples_per_second": 14.512,
"eval_steps_per_second": 14.512,
"step": 7000
},
{
"epoch": 0.04621948328987912,
"grad_norm": 0.05777193233370781,
"learning_rate": 0.002994708052833043,
"loss": 2.0243,
"step": 7020
},
{
"epoch": 0.046351162729451424,
"grad_norm": 0.056196246296167374,
"learning_rate": 0.0029946547789110487,
"loss": 2.0237,
"step": 7040
},
{
"epoch": 0.04648284216902373,
"grad_norm": 0.05449189990758896,
"learning_rate": 0.002994601238655252,
"loss": 2.0229,
"step": 7060
},
{
"epoch": 0.046614521608596034,
"grad_norm": 0.05653191730380058,
"learning_rate": 0.0029945474320751944,
"loss": 2.0243,
"step": 7080
},
{
"epoch": 0.04674620104816834,
"grad_norm": 0.05763334780931473,
"learning_rate": 0.0029944933591804623,
"loss": 2.0279,
"step": 7100
},
{
"epoch": 0.04687788048774064,
"grad_norm": 0.05874243751168251,
"learning_rate": 0.002994439019980692,
"loss": 2.0081,
"step": 7120
},
{
"epoch": 0.04700955992731295,
"grad_norm": 0.06031106784939766,
"learning_rate": 0.0029943844144855658,
"loss": 1.9983,
"step": 7140
},
{
"epoch": 0.04714123936688525,
"grad_norm": 0.05547622591257095,
"learning_rate": 0.002994329542704814,
"loss": 1.9954,
"step": 7160
},
{
"epoch": 0.04727291880645756,
"grad_norm": 0.05814756825566292,
"learning_rate": 0.002994274404648214,
"loss": 1.9944,
"step": 7180
},
{
"epoch": 0.04740459824602986,
"grad_norm": 0.05669866129755974,
"learning_rate": 0.002994219000325591,
"loss": 1.9852,
"step": 7200
},
{
"epoch": 0.04753627768560217,
"grad_norm": 0.05776144191622734,
"learning_rate": 0.0029941633297468177,
"loss": 1.9788,
"step": 7220
},
{
"epoch": 0.04766795712517447,
"grad_norm": 0.05656075105071068,
"learning_rate": 0.002994107392921814,
"loss": 1.9872,
"step": 7240
},
{
"epoch": 0.047799636564746784,
"grad_norm": 0.05627656355500221,
"learning_rate": 0.0029940511898605476,
"loss": 1.9787,
"step": 7260
},
{
"epoch": 0.04793131600431909,
"grad_norm": 0.05843086168169975,
"learning_rate": 0.002993994720573033,
"loss": 1.9782,
"step": 7280
},
{
"epoch": 0.04806299544389139,
"grad_norm": 0.05826539546251297,
"learning_rate": 0.002993937985069333,
"loss": 1.9819,
"step": 7300
},
{
"epoch": 0.0481946748834637,
"grad_norm": 0.06292963773012161,
"learning_rate": 0.0029938809833595565,
"loss": 1.9696,
"step": 7320
},
{
"epoch": 0.048326354323036,
"grad_norm": 0.057060081511735916,
"learning_rate": 0.0029938237154538616,
"loss": 1.9633,
"step": 7340
},
{
"epoch": 0.04845803376260831,
"grad_norm": 0.06161024048924446,
"learning_rate": 0.0029937661813624525,
"loss": 1.9623,
"step": 7360
},
{
"epoch": 0.04858971320218061,
"grad_norm": 0.05789177492260933,
"learning_rate": 0.0029937083810955807,
"loss": 1.9724,
"step": 7380
},
{
"epoch": 0.04872139264175292,
"grad_norm": 0.055680371820926666,
"learning_rate": 0.0029936503146635466,
"loss": 1.9657,
"step": 7400
},
{
"epoch": 0.04885307208132522,
"grad_norm": 0.05655812472105026,
"learning_rate": 0.0029935919820766967,
"loss": 1.9664,
"step": 7420
},
{
"epoch": 0.048984751520897526,
"grad_norm": 0.05809199810028076,
"learning_rate": 0.0029935333833454253,
"loss": 1.9728,
"step": 7440
},
{
"epoch": 0.04911643096046983,
"grad_norm": 0.057024531066417694,
"learning_rate": 0.0029934745184801745,
"loss": 1.9637,
"step": 7460
},
{
"epoch": 0.049248110400042136,
"grad_norm": 0.05507376790046692,
"learning_rate": 0.0029934153874914327,
"loss": 1.9646,
"step": 7480
},
{
"epoch": 0.04937978983961444,
"grad_norm": 0.0562782883644104,
"learning_rate": 0.0029933559903897373,
"loss": 1.9642,
"step": 7500
},
{
"epoch": 0.049511469279186746,
"grad_norm": 0.05876750499010086,
"learning_rate": 0.002993296327185672,
"loss": 1.96,
"step": 7520
},
{
"epoch": 0.04964314871875905,
"grad_norm": 0.0542948879301548,
"learning_rate": 0.0029932363978898684,
"loss": 1.957,
"step": 7540
},
{
"epoch": 0.049774828158331355,
"grad_norm": 0.05514788627624512,
"learning_rate": 0.0029931762025130052,
"loss": 1.956,
"step": 7560
},
{
"epoch": 0.04990650759790366,
"grad_norm": 0.055275484919548035,
"learning_rate": 0.0029931157410658087,
"loss": 1.9586,
"step": 7580
},
{
"epoch": 0.05003818703747597,
"grad_norm": 0.06243159994482994,
"learning_rate": 0.0029930550135590524,
"loss": 1.9528,
"step": 7600
},
{
"epoch": 0.050169866477048276,
"grad_norm": 0.055291496217250824,
"learning_rate": 0.0029929940200035575,
"loss": 1.9535,
"step": 7620
},
{
"epoch": 0.05030154591662058,
"grad_norm": 0.0554860420525074,
"learning_rate": 0.002992932760410193,
"loss": 1.9573,
"step": 7640
},
{
"epoch": 0.050433225356192886,
"grad_norm": 0.058307211846113205,
"learning_rate": 0.0029928712347898736,
"loss": 1.9489,
"step": 7660
},
{
"epoch": 0.05056490479576519,
"grad_norm": 0.057058483362197876,
"learning_rate": 0.0029928094431535637,
"loss": 1.9564,
"step": 7680
},
{
"epoch": 0.050696584235337495,
"grad_norm": 0.055521443486213684,
"learning_rate": 0.0029927473855122736,
"loss": 1.967,
"step": 7700
},
{
"epoch": 0.0508282636749098,
"grad_norm": 0.05751781165599823,
"learning_rate": 0.0029926850618770618,
"loss": 1.9694,
"step": 7720
},
{
"epoch": 0.050959943114482105,
"grad_norm": 0.05835530161857605,
"learning_rate": 0.002992622472259033,
"loss": 1.9706,
"step": 7740
},
{
"epoch": 0.05109162255405441,
"grad_norm": 0.05460565164685249,
"learning_rate": 0.0029925596166693403,
"loss": 1.9652,
"step": 7760
},
{
"epoch": 0.051223301993626714,
"grad_norm": 0.05999600142240524,
"learning_rate": 0.0029924964951191847,
"loss": 1.9628,
"step": 7780
},
{
"epoch": 0.05135498143319902,
"grad_norm": 0.05896478518843651,
"learning_rate": 0.0029924331076198133,
"loss": 1.9625,
"step": 7800
},
{
"epoch": 0.051486660872771324,
"grad_norm": 0.05324622988700867,
"learning_rate": 0.0029923694541825214,
"loss": 1.9593,
"step": 7820
},
{
"epoch": 0.05161834031234363,
"grad_norm": 0.056877490133047104,
"learning_rate": 0.002992305534818651,
"loss": 1.9547,
"step": 7840
},
{
"epoch": 0.051750019751915934,
"grad_norm": 0.05267615243792534,
"learning_rate": 0.0029922413495395927,
"loss": 1.9584,
"step": 7860
},
{
"epoch": 0.05188169919148824,
"grad_norm": 0.05451074242591858,
"learning_rate": 0.002992176898356783,
"loss": 1.957,
"step": 7880
},
{
"epoch": 0.05201337863106054,
"grad_norm": 0.0581444576382637,
"learning_rate": 0.0029921121812817074,
"loss": 1.948,
"step": 7900
},
{
"epoch": 0.052145058070632855,
"grad_norm": 0.0567544661462307,
"learning_rate": 0.0029920471983258964,
"loss": 1.947,
"step": 7920
},
{
"epoch": 0.05227673751020516,
"grad_norm": 0.05727114900946617,
"learning_rate": 0.0029919819495009313,
"loss": 1.9494,
"step": 7940
},
{
"epoch": 0.052408416949777464,
"grad_norm": 0.05433478206396103,
"learning_rate": 0.002991916434818437,
"loss": 1.9443,
"step": 7960
},
{
"epoch": 0.05254009638934977,
"grad_norm": 0.055305104702711105,
"learning_rate": 0.002991850654290089,
"loss": 1.9461,
"step": 7980
},
{
"epoch": 0.052671775828922074,
"grad_norm": 0.056631047278642654,
"learning_rate": 0.0029917846079276084,
"loss": 1.9424,
"step": 8000
},
{
"epoch": 0.052671775828922074,
"eval_loss": 1.780034065246582,
"eval_runtime": 67.4451,
"eval_samples_per_second": 14.827,
"eval_steps_per_second": 14.827,
"step": 8000
},
{
"epoch": 0.05280345526849438,
"grad_norm": 0.06008228659629822,
"learning_rate": 0.002991718295742763,
"loss": 1.9402,
"step": 8020
},
{
"epoch": 0.05293513470806668,
"grad_norm": 0.05446495860815048,
"learning_rate": 0.0029916517177473708,
"loss": 1.942,
"step": 8040
},
{
"epoch": 0.05306681414763899,
"grad_norm": 0.06055721640586853,
"learning_rate": 0.002991584873953294,
"loss": 1.9409,
"step": 8060
},
{
"epoch": 0.05319849358721129,
"grad_norm": 0.056658077985048294,
"learning_rate": 0.002991517764372444,
"loss": 1.9384,
"step": 8080
},
{
"epoch": 0.0533301730267836,
"grad_norm": 0.054917097091674805,
"learning_rate": 0.00299145038901678,
"loss": 1.9312,
"step": 8100
},
{
"epoch": 0.0534618524663559,
"grad_norm": 0.05398482084274292,
"learning_rate": 0.0029913827478983057,
"loss": 1.9454,
"step": 8120
},
{
"epoch": 0.05359353190592821,
"grad_norm": 0.05773143097758293,
"learning_rate": 0.002991314841029076,
"loss": 1.9394,
"step": 8140
},
{
"epoch": 0.05372521134550051,
"grad_norm": 0.0562208853662014,
"learning_rate": 0.0029912466684211907,
"loss": 1.94,
"step": 8160
},
{
"epoch": 0.05385689078507282,
"grad_norm": 0.05213721841573715,
"learning_rate": 0.002991178230086797,
"loss": 1.928,
"step": 8180
},
{
"epoch": 0.05398857022464512,
"grad_norm": 0.05434253811836243,
"learning_rate": 0.0029911095260380903,
"loss": 1.9361,
"step": 8200
},
{
"epoch": 0.054120249664217426,
"grad_norm": 0.0537894032895565,
"learning_rate": 0.0029910405562873135,
"loss": 1.9368,
"step": 8220
},
{
"epoch": 0.05425192910378973,
"grad_norm": 0.055712759494781494,
"learning_rate": 0.0029909713208467557,
"loss": 1.9253,
"step": 8240
},
{
"epoch": 0.05438360854336204,
"grad_norm": 0.0564916618168354,
"learning_rate": 0.0029909018197287543,
"loss": 1.936,
"step": 8260
},
{
"epoch": 0.05451528798293435,
"grad_norm": 0.059347622096538544,
"learning_rate": 0.002990832052945694,
"loss": 1.9872,
"step": 8280
},
{
"epoch": 0.05464696742250665,
"grad_norm": 0.05435614287853241,
"learning_rate": 0.002990762020510006,
"loss": 2.0069,
"step": 8300
},
{
"epoch": 0.05477864686207896,
"grad_norm": 0.05343768745660782,
"learning_rate": 0.0029906917224341704,
"loss": 2.0144,
"step": 8320
},
{
"epoch": 0.05491032630165126,
"grad_norm": 0.054454583674669266,
"learning_rate": 0.0029906211587307128,
"loss": 2.0294,
"step": 8340
},
{
"epoch": 0.05504200574122357,
"grad_norm": 0.05322398245334625,
"learning_rate": 0.002990550329412207,
"loss": 2.0255,
"step": 8360
},
{
"epoch": 0.05517368518079587,
"grad_norm": 0.0558038055896759,
"learning_rate": 0.002990479234491275,
"loss": 2.0239,
"step": 8380
},
{
"epoch": 0.055305364620368176,
"grad_norm": 0.0529707595705986,
"learning_rate": 0.002990407873980584,
"loss": 2.0235,
"step": 8400
},
{
"epoch": 0.05543704405994048,
"grad_norm": 0.049640074372291565,
"learning_rate": 0.002990336247892851,
"loss": 2.0226,
"step": 8420
},
{
"epoch": 0.055568723499512786,
"grad_norm": 0.05250220373272896,
"learning_rate": 0.0029902643562408388,
"loss": 2.0082,
"step": 8440
},
{
"epoch": 0.05570040293908509,
"grad_norm": 0.05764392018318176,
"learning_rate": 0.0029901921990373574,
"loss": 2.0135,
"step": 8460
},
{
"epoch": 0.055832082378657395,
"grad_norm": 0.0569184236228466,
"learning_rate": 0.0029901197762952645,
"loss": 2.0064,
"step": 8480
},
{
"epoch": 0.0559637618182297,
"grad_norm": 0.05316290259361267,
"learning_rate": 0.0029900470880274655,
"loss": 1.9979,
"step": 8500
},
{
"epoch": 0.056095441257802005,
"grad_norm": 0.05095953494310379,
"learning_rate": 0.002989974134246913,
"loss": 2.0072,
"step": 8520
},
{
"epoch": 0.05622712069737431,
"grad_norm": 0.06118274852633476,
"learning_rate": 0.002989900914966606,
"loss": 2.0055,
"step": 8540
},
{
"epoch": 0.056358800136946614,
"grad_norm": 0.05806516483426094,
"learning_rate": 0.0029898274301995926,
"loss": 1.9939,
"step": 8560
},
{
"epoch": 0.05649047957651892,
"grad_norm": 0.05719646438956261,
"learning_rate": 0.0029897536799589662,
"loss": 1.9945,
"step": 8580
},
{
"epoch": 0.05662215901609123,
"grad_norm": 0.05527440831065178,
"learning_rate": 0.0029896796642578686,
"loss": 1.9894,
"step": 8600
},
{
"epoch": 0.056753838455663536,
"grad_norm": 0.0631207823753357,
"learning_rate": 0.002989605383109489,
"loss": 1.994,
"step": 8620
},
{
"epoch": 0.05688551789523584,
"grad_norm": 0.054478082805871964,
"learning_rate": 0.002989530836527063,
"loss": 1.9867,
"step": 8640
},
{
"epoch": 0.057017197334808145,
"grad_norm": 0.05206460878252983,
"learning_rate": 0.002989456024523875,
"loss": 1.9807,
"step": 8660
},
{
"epoch": 0.05714887677438045,
"grad_norm": 0.05099276080727577,
"learning_rate": 0.002989380947113255,
"loss": 1.983,
"step": 8680
},
{
"epoch": 0.057280556213952755,
"grad_norm": 0.05928613618016243,
"learning_rate": 0.0029893056043085813,
"loss": 1.9792,
"step": 8700
},
{
"epoch": 0.05741223565352506,
"grad_norm": 0.04971221461892128,
"learning_rate": 0.0029892299961232797,
"loss": 1.9756,
"step": 8720
},
{
"epoch": 0.057543915093097364,
"grad_norm": 0.060248006135225296,
"learning_rate": 0.002989154122570823,
"loss": 1.9837,
"step": 8740
},
{
"epoch": 0.05767559453266967,
"grad_norm": 0.058486610651016235,
"learning_rate": 0.0029890779836647305,
"loss": 1.9781,
"step": 8760
},
{
"epoch": 0.057807273972241974,
"grad_norm": 0.05129622295498848,
"learning_rate": 0.00298900157941857,
"loss": 1.972,
"step": 8780
},
{
"epoch": 0.05793895341181428,
"grad_norm": 0.052501507103443146,
"learning_rate": 0.002988924909845955,
"loss": 1.9731,
"step": 8800
},
{
"epoch": 0.05807063285138658,
"grad_norm": 0.055490028113126755,
"learning_rate": 0.0029888479749605487,
"loss": 1.9697,
"step": 8820
},
{
"epoch": 0.05820231229095889,
"grad_norm": 0.05250798165798187,
"learning_rate": 0.0029887707747760597,
"loss": 1.9722,
"step": 8840
},
{
"epoch": 0.05833399173053119,
"grad_norm": 0.053195856511592865,
"learning_rate": 0.0029886933093062444,
"loss": 1.9829,
"step": 8860
},
{
"epoch": 0.0584656711701035,
"grad_norm": 0.05129017308354378,
"learning_rate": 0.002988615578564906,
"loss": 1.9818,
"step": 8880
},
{
"epoch": 0.0585973506096758,
"grad_norm": 0.05016680434346199,
"learning_rate": 0.0029885375825658956,
"loss": 1.9915,
"step": 8900
},
{
"epoch": 0.05872903004924811,
"grad_norm": 0.054276566952466965,
"learning_rate": 0.0029884593213231115,
"loss": 1.986,
"step": 8920
},
{
"epoch": 0.05886070948882042,
"grad_norm": 0.05341557413339615,
"learning_rate": 0.0029883807948504998,
"loss": 1.9816,
"step": 8940
},
{
"epoch": 0.058992388928392724,
"grad_norm": 0.05010661855340004,
"learning_rate": 0.002988302003162052,
"loss": 1.9822,
"step": 8960
},
{
"epoch": 0.05912406836796503,
"grad_norm": 0.06433503329753876,
"learning_rate": 0.0029882229462718088,
"loss": 1.9838,
"step": 8980
},
{
"epoch": 0.05925574780753733,
"grad_norm": 0.0578884556889534,
"learning_rate": 0.002988143624193857,
"loss": 1.9786,
"step": 9000
},
{
"epoch": 0.05925574780753733,
"eval_loss": 1.9106996059417725,
"eval_runtime": 67.8585,
"eval_samples_per_second": 14.737,
"eval_steps_per_second": 14.737,
"step": 9000
},
{
"epoch": 0.05938742724710964,
"grad_norm": 0.0511951707303524,
"learning_rate": 0.0029880640369423315,
"loss": 1.9788,
"step": 9020
},
{
"epoch": 0.05951910668668194,
"grad_norm": 0.04770907759666443,
"learning_rate": 0.0029879841845314135,
"loss": 1.975,
"step": 9040
},
{
"epoch": 0.05965078612625425,
"grad_norm": 0.052814580500125885,
"learning_rate": 0.0029879040669753324,
"loss": 1.9674,
"step": 9060
},
{
"epoch": 0.05978246556582655,
"grad_norm": 0.05619759112596512,
"learning_rate": 0.0029878236842883644,
"loss": 1.9686,
"step": 9080
},
{
"epoch": 0.05991414500539886,
"grad_norm": 0.052855897694826126,
"learning_rate": 0.0029877430364848327,
"loss": 1.9591,
"step": 9100
},
{
"epoch": 0.06004582444497116,
"grad_norm": 0.06869558244943619,
"learning_rate": 0.002987662123579108,
"loss": 1.9603,
"step": 9120
},
{
"epoch": 0.060177503884543466,
"grad_norm": 0.04893792048096657,
"learning_rate": 0.002987580945585609,
"loss": 1.9669,
"step": 9140
},
{
"epoch": 0.06030918332411577,
"grad_norm": 0.06035724654793739,
"learning_rate": 0.0029874995025188,
"loss": 1.9693,
"step": 9160
},
{
"epoch": 0.060440862763688076,
"grad_norm": 0.05003412812948227,
"learning_rate": 0.002987417794393193,
"loss": 1.961,
"step": 9180
},
{
"epoch": 0.06057254220326038,
"grad_norm": 0.051062557846307755,
"learning_rate": 0.002987335821223349,
"loss": 1.9568,
"step": 9200
},
{
"epoch": 0.060704221642832686,
"grad_norm": 0.05019828677177429,
"learning_rate": 0.002987253583023874,
"loss": 1.9529,
"step": 9220
},
{
"epoch": 0.06083590108240499,
"grad_norm": 0.05402472987771034,
"learning_rate": 0.0029871710798094224,
"loss": 1.9579,
"step": 9240
},
{
"epoch": 0.060967580521977295,
"grad_norm": 0.06498553603887558,
"learning_rate": 0.002987088311594695,
"loss": 1.9526,
"step": 9260
},
{
"epoch": 0.06109925996154961,
"grad_norm": 0.06526941061019897,
"learning_rate": 0.0029870052783944412,
"loss": 1.9554,
"step": 9280
},
{
"epoch": 0.06123093940112191,
"grad_norm": 0.051123786717653275,
"learning_rate": 0.002986921980223456,
"loss": 1.9449,
"step": 9300
},
{
"epoch": 0.061362618840694216,
"grad_norm": 0.05042225867509842,
"learning_rate": 0.002986838417096583,
"loss": 1.952,
"step": 9320
},
{
"epoch": 0.06149429828026652,
"grad_norm": 0.052252884954214096,
"learning_rate": 0.002986754589028711,
"loss": 1.9459,
"step": 9340
},
{
"epoch": 0.061625977719838826,
"grad_norm": 0.049406830221414566,
"learning_rate": 0.002986670496034779,
"loss": 1.9478,
"step": 9360
},
{
"epoch": 0.06175765715941113,
"grad_norm": 0.051424238830804825,
"learning_rate": 0.0029865861381297714,
"loss": 1.9434,
"step": 9380
},
{
"epoch": 0.061889336598983435,
"grad_norm": 0.05527883395552635,
"learning_rate": 0.0029865015153287193,
"loss": 1.9428,
"step": 9400
},
{
"epoch": 0.06202101603855574,
"grad_norm": 0.048182398080825806,
"learning_rate": 0.0029864166276467024,
"loss": 1.9404,
"step": 9420
},
{
"epoch": 0.062152695478128045,
"grad_norm": 0.04890589416027069,
"learning_rate": 0.002986331475098846,
"loss": 1.9342,
"step": 9440
},
{
"epoch": 0.06228437491770035,
"grad_norm": 0.052375294268131256,
"learning_rate": 0.0029862460577003247,
"loss": 1.9291,
"step": 9460
},
{
"epoch": 0.062416054357272654,
"grad_norm": 0.0541619248688221,
"learning_rate": 0.002986160375466358,
"loss": 1.883,
"step": 9480
},
{
"epoch": 0.06254773379684496,
"grad_norm": 0.05440934747457504,
"learning_rate": 0.002986074428412214,
"loss": 1.8321,
"step": 9500
},
{
"epoch": 0.06267941323641726,
"grad_norm": 0.06579524278640747,
"learning_rate": 0.0029859882165532087,
"loss": 1.8184,
"step": 9520
},
{
"epoch": 0.06281109267598957,
"grad_norm": 0.050777874886989594,
"learning_rate": 0.0029859017399047026,
"loss": 1.8232,
"step": 9540
},
{
"epoch": 0.06294277211556187,
"grad_norm": 0.05892116203904152,
"learning_rate": 0.002985814998482106,
"loss": 1.8241,
"step": 9560
},
{
"epoch": 0.06307445155513418,
"grad_norm": 0.054253749549388885,
"learning_rate": 0.0029857279923008757,
"loss": 1.812,
"step": 9580
},
{
"epoch": 0.06320613099470648,
"grad_norm": 0.05559428408741951,
"learning_rate": 0.0029856407213765144,
"loss": 1.8166,
"step": 9600
},
{
"epoch": 0.06333781043427879,
"grad_norm": 0.0527789331972599,
"learning_rate": 0.0029855531857245735,
"loss": 1.8244,
"step": 9620
},
{
"epoch": 0.06346948987385109,
"grad_norm": 0.05062944442033768,
"learning_rate": 0.0029854653853606515,
"loss": 1.8276,
"step": 9640
},
{
"epoch": 0.0636011693134234,
"grad_norm": 0.05144268646836281,
"learning_rate": 0.002985377320300393,
"loss": 1.8178,
"step": 9660
},
{
"epoch": 0.0637328487529957,
"grad_norm": 0.051822349429130554,
"learning_rate": 0.0029852889905594903,
"loss": 1.8238,
"step": 9680
},
{
"epoch": 0.06386452819256801,
"grad_norm": 0.05682462826371193,
"learning_rate": 0.0029852003961536844,
"loss": 1.8207,
"step": 9700
},
{
"epoch": 0.06399620763214031,
"grad_norm": 0.06278064101934433,
"learning_rate": 0.00298511153709876,
"loss": 1.8311,
"step": 9720
},
{
"epoch": 0.06412788707171262,
"grad_norm": 0.052284616976976395,
"learning_rate": 0.0029850224134105514,
"loss": 1.8243,
"step": 9740
},
{
"epoch": 0.06425956651128492,
"grad_norm": 0.06791289150714874,
"learning_rate": 0.0029849330251049406,
"loss": 1.8252,
"step": 9760
},
{
"epoch": 0.06439124595085724,
"grad_norm": 0.05337266996502876,
"learning_rate": 0.0029848433721978555,
"loss": 1.829,
"step": 9780
},
{
"epoch": 0.06452292539042954,
"grad_norm": 0.05477340891957283,
"learning_rate": 0.002984753454705271,
"loss": 1.8226,
"step": 9800
},
{
"epoch": 0.06465460483000185,
"grad_norm": 0.055485792458057404,
"learning_rate": 0.00298466327264321,
"loss": 1.8205,
"step": 9820
},
{
"epoch": 0.06478628426957415,
"grad_norm": 0.05361747369170189,
"learning_rate": 0.0029845728260277414,
"loss": 1.8327,
"step": 9840
},
{
"epoch": 0.06491796370914646,
"grad_norm": 0.06504777073860168,
"learning_rate": 0.0029844821148749825,
"loss": 1.8292,
"step": 9860
},
{
"epoch": 0.06504964314871876,
"grad_norm": 0.05408887565135956,
"learning_rate": 0.002984391139201097,
"loss": 1.8295,
"step": 9880
},
{
"epoch": 0.06518132258829107,
"grad_norm": 0.0615227073431015,
"learning_rate": 0.0029842998990222964,
"loss": 1.8233,
"step": 9900
},
{
"epoch": 0.06531300202786337,
"grad_norm": 0.05818536877632141,
"learning_rate": 0.002984208394354838,
"loss": 1.8261,
"step": 9920
},
{
"epoch": 0.06544468146743568,
"grad_norm": 0.057526398450136185,
"learning_rate": 0.0029841166252150284,
"loss": 1.8294,
"step": 9940
},
{
"epoch": 0.06557636090700798,
"grad_norm": 0.05408645048737526,
"learning_rate": 0.002984024591619219,
"loss": 1.8248,
"step": 9960
},
{
"epoch": 0.06570804034658029,
"grad_norm": 0.05534709617495537,
"learning_rate": 0.0029839322935838095,
"loss": 1.8263,
"step": 9980
},
{
"epoch": 0.06583971978615259,
"grad_norm": 0.05544685944914818,
"learning_rate": 0.002983839731125246,
"loss": 1.8239,
"step": 10000
},
{
"epoch": 0.06583971978615259,
"eval_loss": 1.968814492225647,
"eval_runtime": 68.0355,
"eval_samples_per_second": 14.698,
"eval_steps_per_second": 14.698,
"step": 10000
},
{
"epoch": 0.0659713992257249,
"grad_norm": 0.052884284406900406,
"learning_rate": 0.002983746904260024,
"loss": 1.8226,
"step": 10020
},
{
"epoch": 0.0661030786652972,
"grad_norm": 0.06210578605532646,
"learning_rate": 0.002983653813004683,
"loss": 1.8562,
"step": 10040
},
{
"epoch": 0.0662347581048695,
"grad_norm": 0.05301567539572716,
"learning_rate": 0.002983560457375811,
"loss": 1.9107,
"step": 10060
},
{
"epoch": 0.06636643754444181,
"grad_norm": 0.056775398552417755,
"learning_rate": 0.0029834668373900437,
"loss": 1.9256,
"step": 10080
},
{
"epoch": 0.06649811698401412,
"grad_norm": 0.05117955058813095,
"learning_rate": 0.002983372953064063,
"loss": 1.9391,
"step": 10100
},
{
"epoch": 0.06662979642358642,
"grad_norm": 0.04930364713072777,
"learning_rate": 0.0029832788044145985,
"loss": 1.9415,
"step": 10120
},
{
"epoch": 0.06676147586315873,
"grad_norm": 0.0544724240899086,
"learning_rate": 0.002983184391458426,
"loss": 1.9422,
"step": 10140
},
{
"epoch": 0.06689315530273103,
"grad_norm": 0.05356570705771446,
"learning_rate": 0.0029830897142123698,
"loss": 1.9259,
"step": 10160
},
{
"epoch": 0.06702483474230334,
"grad_norm": 0.05016016215085983,
"learning_rate": 0.0029829947726933005,
"loss": 1.9262,
"step": 10180
},
{
"epoch": 0.06715651418187564,
"grad_norm": 0.05329560115933418,
"learning_rate": 0.002982899566918135,
"loss": 1.9342,
"step": 10200
},
{
"epoch": 0.06728819362144794,
"grad_norm": 0.053507186472415924,
"learning_rate": 0.0029828040969038386,
"loss": 1.9217,
"step": 10220
},
{
"epoch": 0.06741987306102025,
"grad_norm": 0.05592430755496025,
"learning_rate": 0.002982708362667423,
"loss": 1.9244,
"step": 10240
},
{
"epoch": 0.06755155250059255,
"grad_norm": 0.05031822621822357,
"learning_rate": 0.0029826123642259475,
"loss": 1.9163,
"step": 10260
},
{
"epoch": 0.06768323194016486,
"grad_norm": 0.05068674683570862,
"learning_rate": 0.0029825161015965183,
"loss": 1.9224,
"step": 10280
},
{
"epoch": 0.06781491137973716,
"grad_norm": 0.05538354441523552,
"learning_rate": 0.002982419574796288,
"loss": 1.9166,
"step": 10300
},
{
"epoch": 0.06794659081930947,
"grad_norm": 0.04972713813185692,
"learning_rate": 0.002982322783842457,
"loss": 1.9165,
"step": 10320
},
{
"epoch": 0.06807827025888177,
"grad_norm": 0.05182690918445587,
"learning_rate": 0.0029822257287522727,
"loss": 1.9025,
"step": 10340
},
{
"epoch": 0.06820994969845408,
"grad_norm": 0.0539088249206543,
"learning_rate": 0.002982128409543029,
"loss": 1.9039,
"step": 10360
},
{
"epoch": 0.06834162913802638,
"grad_norm": 0.0529555045068264,
"learning_rate": 0.0029820308262320677,
"loss": 1.8987,
"step": 10380
},
{
"epoch": 0.06847330857759869,
"grad_norm": 0.04998824745416641,
"learning_rate": 0.0029819329788367773,
"loss": 1.9015,
"step": 10400
},
{
"epoch": 0.06860498801717099,
"grad_norm": 0.055027175694704056,
"learning_rate": 0.0029818348673745928,
"loss": 1.9022,
"step": 10420
},
{
"epoch": 0.0687366674567433,
"grad_norm": 0.04936603456735611,
"learning_rate": 0.002981736491862997,
"loss": 1.8981,
"step": 10440
},
{
"epoch": 0.06886834689631562,
"grad_norm": 0.05445968732237816,
"learning_rate": 0.00298163785231952,
"loss": 1.8922,
"step": 10460
},
{
"epoch": 0.06900002633588792,
"grad_norm": 0.0514165423810482,
"learning_rate": 0.0029815389487617377,
"loss": 1.8941,
"step": 10480
},
{
"epoch": 0.06913170577546023,
"grad_norm": 0.054617028683423996,
"learning_rate": 0.002981439781207275,
"loss": 1.8771,
"step": 10500
},
{
"epoch": 0.06926338521503253,
"grad_norm": 0.051449310034513474,
"learning_rate": 0.002981340349673801,
"loss": 1.8979,
"step": 10520
},
{
"epoch": 0.06939506465460483,
"grad_norm": 0.04865436255931854,
"learning_rate": 0.0029812406541790347,
"loss": 1.8929,
"step": 10540
},
{
"epoch": 0.06952674409417714,
"grad_norm": 0.06338293850421906,
"learning_rate": 0.0029811406947407404,
"loss": 1.8849,
"step": 10560
},
{
"epoch": 0.06965842353374944,
"grad_norm": 0.058406732976436615,
"learning_rate": 0.00298104047137673,
"loss": 1.8869,
"step": 10580
},
{
"epoch": 0.06979010297332175,
"grad_norm": 0.05265038460493088,
"learning_rate": 0.002980939984104863,
"loss": 1.8807,
"step": 10600
},
{
"epoch": 0.06992178241289405,
"grad_norm": 0.05860557034611702,
"learning_rate": 0.0029808392329430445,
"loss": 1.8926,
"step": 10620
},
{
"epoch": 0.07005346185246636,
"grad_norm": 0.05650535598397255,
"learning_rate": 0.0029807382179092277,
"loss": 1.9136,
"step": 10640
},
{
"epoch": 0.07018514129203866,
"grad_norm": 0.05268057808279991,
"learning_rate": 0.0029806369390214123,
"loss": 1.9313,
"step": 10660
},
{
"epoch": 0.07031682073161097,
"grad_norm": 0.05681426078081131,
"learning_rate": 0.002980535396297646,
"loss": 1.9358,
"step": 10680
},
{
"epoch": 0.07044850017118327,
"grad_norm": 0.06345421820878983,
"learning_rate": 0.002980433589756022,
"loss": 1.9411,
"step": 10700
},
{
"epoch": 0.07058017961075558,
"grad_norm": 0.04853732883930206,
"learning_rate": 0.002980331519414682,
"loss": 1.9494,
"step": 10720
},
{
"epoch": 0.07071185905032788,
"grad_norm": 0.047528378665447235,
"learning_rate": 0.002980229185291814,
"loss": 1.9364,
"step": 10740
},
{
"epoch": 0.07084353848990019,
"grad_norm": 0.05809812992811203,
"learning_rate": 0.002980126587405652,
"loss": 1.9358,
"step": 10760
},
{
"epoch": 0.07097521792947249,
"grad_norm": 0.05844232812523842,
"learning_rate": 0.0029800237257744788,
"loss": 1.9357,
"step": 10780
},
{
"epoch": 0.0711068973690448,
"grad_norm": 0.04900583252310753,
"learning_rate": 0.0029799206004166236,
"loss": 1.9339,
"step": 10800
},
{
"epoch": 0.0712385768086171,
"grad_norm": 0.056056343019008636,
"learning_rate": 0.002979817211350462,
"loss": 1.9213,
"step": 10820
},
{
"epoch": 0.0713702562481894,
"grad_norm": 0.04929627478122711,
"learning_rate": 0.002979713558594416,
"loss": 1.9238,
"step": 10840
},
{
"epoch": 0.07150193568776171,
"grad_norm": 0.051502469927072525,
"learning_rate": 0.002979609642166958,
"loss": 1.9297,
"step": 10860
},
{
"epoch": 0.07163361512733402,
"grad_norm": 0.055544495582580566,
"learning_rate": 0.002979505462086603,
"loss": 1.9126,
"step": 10880
},
{
"epoch": 0.07176529456690632,
"grad_norm": 0.05013841763138771,
"learning_rate": 0.002979401018371915,
"loss": 1.9167,
"step": 10900
},
{
"epoch": 0.07189697400647863,
"grad_norm": 0.05101664736866951,
"learning_rate": 0.002979296311041506,
"loss": 1.9099,
"step": 10920
},
{
"epoch": 0.07202865344605093,
"grad_norm": 0.06268607825040817,
"learning_rate": 0.0029791913401140332,
"loss": 1.9139,
"step": 10940
},
{
"epoch": 0.07216033288562324,
"grad_norm": 0.05222015082836151,
"learning_rate": 0.002979086105608202,
"loss": 1.911,
"step": 10960
},
{
"epoch": 0.07229201232519554,
"grad_norm": 0.054124996066093445,
"learning_rate": 0.002978980607542763,
"loss": 1.9097,
"step": 10980
},
{
"epoch": 0.07242369176476784,
"grad_norm": 0.05831436067819595,
"learning_rate": 0.0029788748459365164,
"loss": 1.9166,
"step": 11000
},
{
"epoch": 0.07242369176476784,
"eval_loss": 1.9284849166870117,
"eval_runtime": 67.5794,
"eval_samples_per_second": 14.797,
"eval_steps_per_second": 14.797,
"step": 11000
},
{
"epoch": 0.07255537120434015,
"grad_norm": 0.056505072861909866,
"learning_rate": 0.0029787688208083073,
"loss": 1.9091,
"step": 11020
},
{
"epoch": 0.07268705064391245,
"grad_norm": 0.04782087355852127,
"learning_rate": 0.002978662532177028,
"loss": 1.9054,
"step": 11040
},
{
"epoch": 0.07281873008348476,
"grad_norm": 0.05616345256567001,
"learning_rate": 0.002978555980061619,
"loss": 1.9027,
"step": 11060
},
{
"epoch": 0.07295040952305706,
"grad_norm": 0.0646371841430664,
"learning_rate": 0.002978449164481066,
"loss": 1.8956,
"step": 11080
},
{
"epoch": 0.07308208896262937,
"grad_norm": 0.0588691271841526,
"learning_rate": 0.0029783420854544037,
"loss": 1.8958,
"step": 11100
},
{
"epoch": 0.07321376840220169,
"grad_norm": 0.05876161903142929,
"learning_rate": 0.0029782347430007115,
"loss": 1.898,
"step": 11120
},
{
"epoch": 0.07334544784177399,
"grad_norm": 0.05978132411837578,
"learning_rate": 0.0029781271371391175,
"loss": 1.9033,
"step": 11140
},
{
"epoch": 0.0734771272813463,
"grad_norm": 0.05216595530509949,
"learning_rate": 0.0029780192678887964,
"loss": 1.8997,
"step": 11160
},
{
"epoch": 0.0736088067209186,
"grad_norm": 0.0518871508538723,
"learning_rate": 0.002977911135268968,
"loss": 1.9014,
"step": 11180
},
{
"epoch": 0.0737404861604909,
"grad_norm": 0.05054188892245293,
"learning_rate": 0.0029778027392989024,
"loss": 1.8899,
"step": 11200
},
{
"epoch": 0.07387216560006321,
"grad_norm": 0.059255532920360565,
"learning_rate": 0.002977694079997913,
"loss": 1.8928,
"step": 11220
},
{
"epoch": 0.07400384503963552,
"grad_norm": 0.06282193213701248,
"learning_rate": 0.002977585157385364,
"loss": 1.9071,
"step": 11240
},
{
"epoch": 0.07413552447920782,
"grad_norm": 0.048698440194129944,
"learning_rate": 0.0029774759714806622,
"loss": 1.9165,
"step": 11260
},
{
"epoch": 0.07426720391878013,
"grad_norm": 0.05037577450275421,
"learning_rate": 0.0029773665223032653,
"loss": 1.9154,
"step": 11280
},
{
"epoch": 0.07439888335835243,
"grad_norm": 0.049512796103954315,
"learning_rate": 0.002977256809872675,
"loss": 1.911,
"step": 11300
},
{
"epoch": 0.07453056279792473,
"grad_norm": 0.05632052198052406,
"learning_rate": 0.0029771468342084414,
"loss": 1.9104,
"step": 11320
},
{
"epoch": 0.07466224223749704,
"grad_norm": 0.050531480461359024,
"learning_rate": 0.0029770365953301616,
"loss": 1.9071,
"step": 11340
},
{
"epoch": 0.07479392167706934,
"grad_norm": 0.057267602533102036,
"learning_rate": 0.0029769260932574785,
"loss": 1.9078,
"step": 11360
},
{
"epoch": 0.07492560111664165,
"grad_norm": 0.05797697231173515,
"learning_rate": 0.002976815328010083,
"loss": 1.898,
"step": 11380
},
{
"epoch": 0.07505728055621395,
"grad_norm": 0.04657141864299774,
"learning_rate": 0.0029767042996077116,
"loss": 1.8966,
"step": 11400
},
{
"epoch": 0.07518895999578626,
"grad_norm": 0.05821000784635544,
"learning_rate": 0.00297659300807015,
"loss": 1.897,
"step": 11420
},
{
"epoch": 0.07532063943535856,
"grad_norm": 0.050238363444805145,
"learning_rate": 0.0029764814534172282,
"loss": 1.8937,
"step": 11440
},
{
"epoch": 0.07545231887493087,
"grad_norm": 0.04804101213812828,
"learning_rate": 0.0029763696356688244,
"loss": 1.8935,
"step": 11460
},
{
"epoch": 0.07558399831450317,
"grad_norm": 0.057969000190496445,
"learning_rate": 0.002976257554844864,
"loss": 1.8896,
"step": 11480
},
{
"epoch": 0.07571567775407548,
"grad_norm": 0.05278369039297104,
"learning_rate": 0.002976145210965319,
"loss": 1.8918,
"step": 11500
},
{
"epoch": 0.07584735719364778,
"grad_norm": 0.05272908881306648,
"learning_rate": 0.0029760326040502065,
"loss": 1.8896,
"step": 11520
},
{
"epoch": 0.07597903663322009,
"grad_norm": 0.0534030944108963,
"learning_rate": 0.0029759197341195933,
"loss": 1.8833,
"step": 11540
},
{
"epoch": 0.07611071607279239,
"grad_norm": 0.05342519283294678,
"learning_rate": 0.002975806601193592,
"loss": 1.8828,
"step": 11560
},
{
"epoch": 0.0762423955123647,
"grad_norm": 0.05289285629987717,
"learning_rate": 0.002975693205292361,
"loss": 1.8786,
"step": 11580
},
{
"epoch": 0.076374074951937,
"grad_norm": 0.05132855102419853,
"learning_rate": 0.0029755795464361063,
"loss": 1.882,
"step": 11600
},
{
"epoch": 0.0765057543915093,
"grad_norm": 0.057877812534570694,
"learning_rate": 0.0029754656246450822,
"loss": 1.8881,
"step": 11620
},
{
"epoch": 0.07663743383108161,
"grad_norm": 0.054198529571294785,
"learning_rate": 0.002975351439939587,
"loss": 1.8849,
"step": 11640
},
{
"epoch": 0.07676911327065392,
"grad_norm": 0.04742525890469551,
"learning_rate": 0.0029752369923399685,
"loss": 1.8819,
"step": 11660
},
{
"epoch": 0.07690079271022622,
"grad_norm": 0.057487789541482925,
"learning_rate": 0.002975122281866619,
"loss": 1.8751,
"step": 11680
},
{
"epoch": 0.07703247214979853,
"grad_norm": 0.04776060953736305,
"learning_rate": 0.002975007308539981,
"loss": 1.8726,
"step": 11700
},
{
"epoch": 0.07716415158937083,
"grad_norm": 0.05077700316905975,
"learning_rate": 0.002974892072380539,
"loss": 1.876,
"step": 11720
},
{
"epoch": 0.07729583102894313,
"grad_norm": 0.0542939268052578,
"learning_rate": 0.0029747765734088284,
"loss": 1.8788,
"step": 11740
},
{
"epoch": 0.07742751046851544,
"grad_norm": 0.04847322776913643,
"learning_rate": 0.0029746608116454306,
"loss": 1.8705,
"step": 11760
},
{
"epoch": 0.07755918990808774,
"grad_norm": 0.0494987815618515,
"learning_rate": 0.0029745447871109727,
"loss": 1.8776,
"step": 11780
},
{
"epoch": 0.07769086934766006,
"grad_norm": 0.05288725346326828,
"learning_rate": 0.0029744284998261287,
"loss": 1.8733,
"step": 11800
},
{
"epoch": 0.07782254878723237,
"grad_norm": 0.0571809746325016,
"learning_rate": 0.0029743119498116203,
"loss": 1.8761,
"step": 11820
},
{
"epoch": 0.07795422822680467,
"grad_norm": 0.050889961421489716,
"learning_rate": 0.0029741951370882164,
"loss": 1.8692,
"step": 11840
},
{
"epoch": 0.07808590766637698,
"grad_norm": 0.0550447441637516,
"learning_rate": 0.002974078061676731,
"loss": 1.8739,
"step": 11860
},
{
"epoch": 0.07821758710594928,
"grad_norm": 0.05145235359668732,
"learning_rate": 0.002973960723598026,
"loss": 1.8653,
"step": 11880
},
{
"epoch": 0.07834926654552159,
"grad_norm": 0.05060429126024246,
"learning_rate": 0.0029738431228730107,
"loss": 1.8529,
"step": 11900
},
{
"epoch": 0.07848094598509389,
"grad_norm": 0.05473101884126663,
"learning_rate": 0.0029737252595226395,
"loss": 1.8513,
"step": 11920
},
{
"epoch": 0.0786126254246662,
"grad_norm": 0.05369679257273674,
"learning_rate": 0.002973607133567915,
"loss": 1.8473,
"step": 11940
},
{
"epoch": 0.0787443048642385,
"grad_norm": 0.06132115051150322,
"learning_rate": 0.0029734887450298866,
"loss": 1.8426,
"step": 11960
},
{
"epoch": 0.0788759843038108,
"grad_norm": 0.049720194190740585,
"learning_rate": 0.0029733700939296487,
"loss": 1.8412,
"step": 11980
},
{
"epoch": 0.07900766374338311,
"grad_norm": 0.048152726143598557,
"learning_rate": 0.0029732511802883456,
"loss": 1.8388,
"step": 12000
},
{
"epoch": 0.07900766374338311,
"eval_loss": 1.7857414484024048,
"eval_runtime": 68.3192,
"eval_samples_per_second": 14.637,
"eval_steps_per_second": 14.637,
"step": 12000
},
{
"epoch": 0.07913934318295542,
"grad_norm": 0.05637095496058464,
"learning_rate": 0.0029731320041271655,
"loss": 1.8317,
"step": 12020
},
{
"epoch": 0.07927102262252772,
"grad_norm": 0.05279828608036041,
"learning_rate": 0.002973012565467345,
"loss": 1.8265,
"step": 12040
},
{
"epoch": 0.07940270206210003,
"grad_norm": 0.05788380280137062,
"learning_rate": 0.0029728928643301664,
"loss": 1.8285,
"step": 12060
},
{
"epoch": 0.07953438150167233,
"grad_norm": 0.05116511508822441,
"learning_rate": 0.0029727729007369597,
"loss": 1.8305,
"step": 12080
},
{
"epoch": 0.07966606094124463,
"grad_norm": 0.05228397622704506,
"learning_rate": 0.0029726526747091016,
"loss": 1.8299,
"step": 12100
},
{
"epoch": 0.07979774038081694,
"grad_norm": 0.06771951913833618,
"learning_rate": 0.0029725321862680144,
"loss": 1.8221,
"step": 12120
},
{
"epoch": 0.07992941982038924,
"grad_norm": 0.05031878501176834,
"learning_rate": 0.002972411435435169,
"loss": 1.8244,
"step": 12140
},
{
"epoch": 0.08006109925996155,
"grad_norm": 0.057394348084926605,
"learning_rate": 0.0029722904222320825,
"loss": 1.8279,
"step": 12160
},
{
"epoch": 0.08019277869953385,
"grad_norm": 0.05116160586476326,
"learning_rate": 0.0029721691466803165,
"loss": 1.8192,
"step": 12180
},
{
"epoch": 0.08032445813910616,
"grad_norm": 0.05168084427714348,
"learning_rate": 0.002972047608801483,
"loss": 1.8265,
"step": 12200
},
{
"epoch": 0.08045613757867846,
"grad_norm": 0.053319819271564484,
"learning_rate": 0.0029719258086172377,
"loss": 1.8237,
"step": 12220
},
{
"epoch": 0.08058781701825077,
"grad_norm": 0.09060586988925934,
"learning_rate": 0.002971803746149285,
"loss": 1.8176,
"step": 12240
},
{
"epoch": 0.08071949645782307,
"grad_norm": 0.05889497324824333,
"learning_rate": 0.002971681421419375,
"loss": 1.8166,
"step": 12260
},
{
"epoch": 0.08085117589739538,
"grad_norm": 0.056241389364004135,
"learning_rate": 0.002971558834449305,
"loss": 1.8189,
"step": 12280
},
{
"epoch": 0.08098285533696768,
"grad_norm": 0.07331902533769608,
"learning_rate": 0.002971435985260919,
"loss": 1.8173,
"step": 12300
},
{
"epoch": 0.08111453477653999,
"grad_norm": 0.05276619270443916,
"learning_rate": 0.002971312873876107,
"loss": 1.8194,
"step": 12320
},
{
"epoch": 0.08124621421611229,
"grad_norm": 0.052701130509376526,
"learning_rate": 0.002971189500316807,
"loss": 1.808,
"step": 12340
},
{
"epoch": 0.0813778936556846,
"grad_norm": 0.05825614184141159,
"learning_rate": 0.0029710658646050028,
"loss": 1.8206,
"step": 12360
},
{
"epoch": 0.0815095730952569,
"grad_norm": 0.05325302854180336,
"learning_rate": 0.002970941966762725,
"loss": 1.8072,
"step": 12380
},
{
"epoch": 0.0816412525348292,
"grad_norm": 0.05424511805176735,
"learning_rate": 0.0029708178068120514,
"loss": 1.814,
"step": 12400
},
{
"epoch": 0.08177293197440151,
"grad_norm": 0.05035754665732384,
"learning_rate": 0.002970693384775106,
"loss": 1.8281,
"step": 12420
},
{
"epoch": 0.08190461141397382,
"grad_norm": 0.0715329572558403,
"learning_rate": 0.0029705687006740594,
"loss": 1.8342,
"step": 12440
},
{
"epoch": 0.08203629085354612,
"grad_norm": 0.05069407820701599,
"learning_rate": 0.002970443754531129,
"loss": 1.8306,
"step": 12460
},
{
"epoch": 0.08216797029311844,
"grad_norm": 0.05642094835639,
"learning_rate": 0.00297031854636858,
"loss": 1.8252,
"step": 12480
},
{
"epoch": 0.08229964973269074,
"grad_norm": 0.05098734796047211,
"learning_rate": 0.0029701930762087232,
"loss": 1.8283,
"step": 12500
},
{
"epoch": 0.08243132917226305,
"grad_norm": 0.05360301956534386,
"learning_rate": 0.002970067344073915,
"loss": 1.8121,
"step": 12520
},
{
"epoch": 0.08256300861183535,
"grad_norm": 0.064446359872818,
"learning_rate": 0.002969941349986561,
"loss": 1.8167,
"step": 12540
},
{
"epoch": 0.08269468805140766,
"grad_norm": 0.05934213101863861,
"learning_rate": 0.002969815093969112,
"loss": 1.8104,
"step": 12560
},
{
"epoch": 0.08282636749097996,
"grad_norm": 0.05697745084762573,
"learning_rate": 0.0029696885760440647,
"loss": 1.8118,
"step": 12580
},
{
"epoch": 0.08295804693055227,
"grad_norm": 0.05313008651137352,
"learning_rate": 0.0029695617962339645,
"loss": 1.8073,
"step": 12600
},
{
"epoch": 0.08308972637012457,
"grad_norm": 0.05284099653363228,
"learning_rate": 0.002969434754561402,
"loss": 1.8142,
"step": 12620
},
{
"epoch": 0.08322140580969688,
"grad_norm": 0.054485708475112915,
"learning_rate": 0.0029693074510490154,
"loss": 1.8067,
"step": 12640
},
{
"epoch": 0.08335308524926918,
"grad_norm": 0.050835754722356796,
"learning_rate": 0.0029691798857194884,
"loss": 1.8094,
"step": 12660
},
{
"epoch": 0.08348476468884149,
"grad_norm": 0.05048472061753273,
"learning_rate": 0.0029690520585955514,
"loss": 1.8019,
"step": 12680
},
{
"epoch": 0.08361644412841379,
"grad_norm": 0.05250314995646477,
"learning_rate": 0.0029689239696999836,
"loss": 1.7949,
"step": 12700
},
{
"epoch": 0.0837481235679861,
"grad_norm": 0.05029289051890373,
"learning_rate": 0.0029687956190556078,
"loss": 1.8036,
"step": 12720
},
{
"epoch": 0.0838798030075584,
"grad_norm": 0.053878892213106155,
"learning_rate": 0.002968667006685296,
"loss": 1.8019,
"step": 12740
},
{
"epoch": 0.0840114824471307,
"grad_norm": 0.05751722306013107,
"learning_rate": 0.0029685381326119645,
"loss": 1.8014,
"step": 12760
},
{
"epoch": 0.08414316188670301,
"grad_norm": 0.05387134477496147,
"learning_rate": 0.002968408996858579,
"loss": 1.7998,
"step": 12780
},
{
"epoch": 0.08427484132627532,
"grad_norm": 0.056205861270427704,
"learning_rate": 0.002968279599448149,
"loss": 1.8051,
"step": 12800
},
{
"epoch": 0.08440652076584762,
"grad_norm": 0.052303776144981384,
"learning_rate": 0.0029681499404037325,
"loss": 1.7967,
"step": 12820
},
{
"epoch": 0.08453820020541992,
"grad_norm": 0.06636688113212585,
"learning_rate": 0.002968020019748434,
"loss": 1.799,
"step": 12840
},
{
"epoch": 0.08466987964499223,
"grad_norm": 0.05160198360681534,
"learning_rate": 0.0029678898375054036,
"loss": 1.7987,
"step": 12860
},
{
"epoch": 0.08480155908456453,
"grad_norm": 0.05559029057621956,
"learning_rate": 0.002967759393697839,
"loss": 1.8034,
"step": 12880
},
{
"epoch": 0.08493323852413684,
"grad_norm": 0.057246867567300797,
"learning_rate": 0.002967628688348983,
"loss": 1.7888,
"step": 12900
},
{
"epoch": 0.08506491796370914,
"grad_norm": 0.06301821768283844,
"learning_rate": 0.0029674977214821274,
"loss": 1.801,
"step": 12920
},
{
"epoch": 0.08519659740328145,
"grad_norm": 0.055293645709753036,
"learning_rate": 0.0029673664931206085,
"loss": 1.7955,
"step": 12940
},
{
"epoch": 0.08532827684285375,
"grad_norm": 0.05522451177239418,
"learning_rate": 0.0029672350032878105,
"loss": 1.788,
"step": 12960
},
{
"epoch": 0.08545995628242606,
"grad_norm": 0.057026926428079605,
"learning_rate": 0.0029671032520071634,
"loss": 1.7898,
"step": 12980
},
{
"epoch": 0.08559163572199836,
"grad_norm": 0.06190698221325874,
"learning_rate": 0.002966971239302144,
"loss": 1.8188,
"step": 13000
},
{
"epoch": 0.08559163572199836,
"eval_loss": 1.6987569332122803,
"eval_runtime": 70.9806,
"eval_samples_per_second": 14.088,
"eval_steps_per_second": 14.088,
"step": 13000
},
{
"epoch": 0.08572331516157067,
"grad_norm": 0.05302195996046066,
"learning_rate": 0.002966838965196276,
"loss": 1.8589,
"step": 13020
},
{
"epoch": 0.08585499460114297,
"grad_norm": 0.051264405250549316,
"learning_rate": 0.0029667064297131296,
"loss": 1.8669,
"step": 13040
},
{
"epoch": 0.08598667404071528,
"grad_norm": 0.05437634140253067,
"learning_rate": 0.0029665736328763205,
"loss": 1.8685,
"step": 13060
},
{
"epoch": 0.08611835348028758,
"grad_norm": 0.05606294050812721,
"learning_rate": 0.0029664405747095134,
"loss": 1.8787,
"step": 13080
},
{
"epoch": 0.08625003291985989,
"grad_norm": 0.053556881844997406,
"learning_rate": 0.0029663072552364163,
"loss": 1.8788,
"step": 13100
},
{
"epoch": 0.08638171235943219,
"grad_norm": 0.06021646037697792,
"learning_rate": 0.0029661736744807867,
"loss": 1.8733,
"step": 13120
},
{
"epoch": 0.08651339179900451,
"grad_norm": 0.06918266415596008,
"learning_rate": 0.002966039832466427,
"loss": 1.8827,
"step": 13140
},
{
"epoch": 0.08664507123857682,
"grad_norm": 0.052268948405981064,
"learning_rate": 0.002965905729217187,
"loss": 1.8688,
"step": 13160
},
{
"epoch": 0.08677675067814912,
"grad_norm": 0.0564788356423378,
"learning_rate": 0.0029657713647569623,
"loss": 1.8599,
"step": 13180
},
{
"epoch": 0.08690843011772142,
"grad_norm": 0.04878311604261398,
"learning_rate": 0.0029656367391096955,
"loss": 1.8654,
"step": 13200
},
{
"epoch": 0.08704010955729373,
"grad_norm": 0.051273491233587265,
"learning_rate": 0.002965501852299376,
"loss": 1.8634,
"step": 13220
},
{
"epoch": 0.08717178899686603,
"grad_norm": 0.06505248695611954,
"learning_rate": 0.002965366704350039,
"loss": 1.859,
"step": 13240
},
{
"epoch": 0.08730346843643834,
"grad_norm": 0.05197957530617714,
"learning_rate": 0.002965231295285767,
"loss": 1.8631,
"step": 13260
},
{
"epoch": 0.08743514787601064,
"grad_norm": 0.05774524062871933,
"learning_rate": 0.0029650956251306877,
"loss": 1.8508,
"step": 13280
},
{
"epoch": 0.08756682731558295,
"grad_norm": 0.04711959511041641,
"learning_rate": 0.0029649596939089772,
"loss": 1.8488,
"step": 13300
},
{
"epoch": 0.08769850675515525,
"grad_norm": 0.04737945273518562,
"learning_rate": 0.0029648235016448573,
"loss": 1.8546,
"step": 13320
},
{
"epoch": 0.08783018619472756,
"grad_norm": 0.051619525998830795,
"learning_rate": 0.0029646870483625953,
"loss": 1.8514,
"step": 13340
},
{
"epoch": 0.08796186563429986,
"grad_norm": 0.05580944940447807,
"learning_rate": 0.002964550334086507,
"loss": 1.85,
"step": 13360
},
{
"epoch": 0.08809354507387217,
"grad_norm": 0.05655309185385704,
"learning_rate": 0.002964413358840953,
"loss": 1.8456,
"step": 13380
},
{
"epoch": 0.08822522451344447,
"grad_norm": 0.05536419898271561,
"learning_rate": 0.0029642761226503413,
"loss": 1.8375,
"step": 13400
},
{
"epoch": 0.08835690395301678,
"grad_norm": 0.055286381393671036,
"learning_rate": 0.002964138625539126,
"loss": 1.8406,
"step": 13420
},
{
"epoch": 0.08848858339258908,
"grad_norm": 0.07900959998369217,
"learning_rate": 0.0029640008675318077,
"loss": 1.847,
"step": 13440
},
{
"epoch": 0.08862026283216139,
"grad_norm": 0.05409523472189903,
"learning_rate": 0.002963862848652934,
"loss": 1.8483,
"step": 13460
},
{
"epoch": 0.08875194227173369,
"grad_norm": 0.04646017774939537,
"learning_rate": 0.0029637245689270978,
"loss": 1.8357,
"step": 13480
},
{
"epoch": 0.088883621711306,
"grad_norm": 0.05184982717037201,
"learning_rate": 0.0029635860283789405,
"loss": 1.8407,
"step": 13500
},
{
"epoch": 0.0890153011508783,
"grad_norm": 0.05196777358651161,
"learning_rate": 0.0029634472270331476,
"loss": 1.8404,
"step": 13520
},
{
"epoch": 0.0891469805904506,
"grad_norm": 0.0526873879134655,
"learning_rate": 0.0029633081649144528,
"loss": 1.8403,
"step": 13540
},
{
"epoch": 0.08927866003002291,
"grad_norm": 0.06644752621650696,
"learning_rate": 0.0029631688420476356,
"loss": 1.8312,
"step": 13560
},
{
"epoch": 0.08941033946959522,
"grad_norm": 0.06348369270563126,
"learning_rate": 0.002963029258457522,
"loss": 1.8343,
"step": 13580
},
{
"epoch": 0.08954201890916752,
"grad_norm": 0.06941412389278412,
"learning_rate": 0.002962889414168985,
"loss": 1.8488,
"step": 13600
},
{
"epoch": 0.08967369834873982,
"grad_norm": 0.0526285357773304,
"learning_rate": 0.0029627493092069432,
"loss": 1.8645,
"step": 13620
},
{
"epoch": 0.08980537778831213,
"grad_norm": 0.04776741564273834,
"learning_rate": 0.002962608943596362,
"loss": 1.8647,
"step": 13640
},
{
"epoch": 0.08993705722788443,
"grad_norm": 0.05642177537083626,
"learning_rate": 0.0029624683173622526,
"loss": 1.8651,
"step": 13660
},
{
"epoch": 0.09006873666745674,
"grad_norm": 0.04894222691655159,
"learning_rate": 0.0029623274305296743,
"loss": 1.8652,
"step": 13680
},
{
"epoch": 0.09020041610702904,
"grad_norm": 0.05177977308630943,
"learning_rate": 0.0029621862831237314,
"loss": 1.8606,
"step": 13700
},
{
"epoch": 0.09033209554660135,
"grad_norm": 0.05325636267662048,
"learning_rate": 0.0029620448751695757,
"loss": 1.8562,
"step": 13720
},
{
"epoch": 0.09046377498617365,
"grad_norm": 0.053102049976587296,
"learning_rate": 0.0029619032066924037,
"loss": 1.8607,
"step": 13740
},
{
"epoch": 0.09059545442574596,
"grad_norm": 0.06039892137050629,
"learning_rate": 0.0029617612777174604,
"loss": 1.8598,
"step": 13760
},
{
"epoch": 0.09072713386531826,
"grad_norm": 0.05456007272005081,
"learning_rate": 0.0029616190882700358,
"loss": 1.855,
"step": 13780
},
{
"epoch": 0.09085881330489057,
"grad_norm": 0.05931520834565163,
"learning_rate": 0.002961476638375467,
"loss": 1.8562,
"step": 13800
},
{
"epoch": 0.09099049274446289,
"grad_norm": 0.05977236106991768,
"learning_rate": 0.0029613339280591365,
"loss": 1.8562,
"step": 13820
},
{
"epoch": 0.09112217218403519,
"grad_norm": 0.06268831342458725,
"learning_rate": 0.0029611909573464745,
"loss": 1.8472,
"step": 13840
},
{
"epoch": 0.0912538516236075,
"grad_norm": 0.05633818358182907,
"learning_rate": 0.002961047726262958,
"loss": 1.8403,
"step": 13860
},
{
"epoch": 0.0913855310631798,
"grad_norm": 0.0659051239490509,
"learning_rate": 0.0029609042348341078,
"loss": 1.8382,
"step": 13880
},
{
"epoch": 0.0915172105027521,
"grad_norm": 0.050592195242643356,
"learning_rate": 0.0029607604830854937,
"loss": 1.8452,
"step": 13900
},
{
"epoch": 0.09164888994232441,
"grad_norm": 0.049383338540792465,
"learning_rate": 0.0029606164710427314,
"loss": 1.8443,
"step": 13920
},
{
"epoch": 0.09178056938189671,
"grad_norm": 0.06528118252754211,
"learning_rate": 0.002960472198731481,
"loss": 1.8422,
"step": 13940
},
{
"epoch": 0.09191224882146902,
"grad_norm": 0.05411006882786751,
"learning_rate": 0.002960327666177452,
"loss": 1.8465,
"step": 13960
},
{
"epoch": 0.09204392826104132,
"grad_norm": 0.0483255498111248,
"learning_rate": 0.0029601828734063984,
"loss": 1.8427,
"step": 13980
},
{
"epoch": 0.09217560770061363,
"grad_norm": 0.050317153334617615,
"learning_rate": 0.0029600378204441206,
"loss": 1.8339,
"step": 14000
},
{
"epoch": 0.09217560770061363,
"eval_loss": 1.785549283027649,
"eval_runtime": 68.197,
"eval_samples_per_second": 14.663,
"eval_steps_per_second": 14.663,
"step": 14000
},
{
"epoch": 0.09230728714018593,
"grad_norm": 0.05255632847547531,
"learning_rate": 0.0029598925073164657,
"loss": 1.8319,
"step": 14020
},
{
"epoch": 0.09243896657975824,
"grad_norm": 0.053322333842515945,
"learning_rate": 0.0029597469340493275,
"loss": 1.8343,
"step": 14040
},
{
"epoch": 0.09257064601933054,
"grad_norm": 0.046458128839731216,
"learning_rate": 0.0029596011006686454,
"loss": 1.8335,
"step": 14060
},
{
"epoch": 0.09270232545890285,
"grad_norm": 0.051327046006917953,
"learning_rate": 0.0029594550072004062,
"loss": 1.8295,
"step": 14080
},
{
"epoch": 0.09283400489847515,
"grad_norm": 0.06848567724227905,
"learning_rate": 0.002959308653670642,
"loss": 1.8375,
"step": 14100
},
{
"epoch": 0.09296568433804746,
"grad_norm": 0.05707765370607376,
"learning_rate": 0.0029591620401054316,
"loss": 1.8341,
"step": 14120
},
{
"epoch": 0.09309736377761976,
"grad_norm": 0.050898268818855286,
"learning_rate": 0.0029590151665309004,
"loss": 1.8324,
"step": 14140
},
{
"epoch": 0.09322904321719207,
"grad_norm": 0.06690908968448639,
"learning_rate": 0.0029588680329732196,
"loss": 1.8357,
"step": 14160
},
{
"epoch": 0.09336072265676437,
"grad_norm": 0.05576496198773384,
"learning_rate": 0.0029587206394586073,
"loss": 1.827,
"step": 14180
},
{
"epoch": 0.09349240209633668,
"grad_norm": 0.060783933848142624,
"learning_rate": 0.002958572986013328,
"loss": 1.827,
"step": 14200
},
{
"epoch": 0.09362408153590898,
"grad_norm": 0.05840138718485832,
"learning_rate": 0.0029584250726636917,
"loss": 1.8005,
"step": 14220
},
{
"epoch": 0.09375576097548129,
"grad_norm": 0.06067179888486862,
"learning_rate": 0.0029582768994360557,
"loss": 1.7913,
"step": 14240
},
{
"epoch": 0.09388744041505359,
"grad_norm": 0.04877826198935509,
"learning_rate": 0.002958128466356822,
"loss": 1.7808,
"step": 14260
},
{
"epoch": 0.0940191198546259,
"grad_norm": 0.07199737429618835,
"learning_rate": 0.0029579797734524413,
"loss": 1.7692,
"step": 14280
},
{
"epoch": 0.0941507992941982,
"grad_norm": 0.05159222334623337,
"learning_rate": 0.002957830820749409,
"loss": 1.7735,
"step": 14300
},
{
"epoch": 0.0942824787337705,
"grad_norm": 0.05802571773529053,
"learning_rate": 0.0029576816082742662,
"loss": 1.7648,
"step": 14320
},
{
"epoch": 0.09441415817334281,
"grad_norm": 0.05139509588479996,
"learning_rate": 0.0029575321360536025,
"loss": 1.7667,
"step": 14340
},
{
"epoch": 0.09454583761291512,
"grad_norm": 0.06891103833913803,
"learning_rate": 0.002957382404114052,
"loss": 1.766,
"step": 14360
},
{
"epoch": 0.09467751705248742,
"grad_norm": 0.054211389273405075,
"learning_rate": 0.0029572324124822955,
"loss": 1.7576,
"step": 14380
},
{
"epoch": 0.09480919649205972,
"grad_norm": 0.0536891408264637,
"learning_rate": 0.0029570821611850594,
"loss": 1.7597,
"step": 14400
},
{
"epoch": 0.09494087593163203,
"grad_norm": 0.052394088357686996,
"learning_rate": 0.0029569316502491183,
"loss": 1.7645,
"step": 14420
},
{
"epoch": 0.09507255537120433,
"grad_norm": 0.05916254222393036,
"learning_rate": 0.002956780879701291,
"loss": 1.7631,
"step": 14440
},
{
"epoch": 0.09520423481077664,
"grad_norm": 0.060256022959947586,
"learning_rate": 0.0029566298495684444,
"loss": 1.7566,
"step": 14460
},
{
"epoch": 0.09533591425034894,
"grad_norm": 0.055872827768325806,
"learning_rate": 0.0029564785598774897,
"loss": 1.7536,
"step": 14480
},
{
"epoch": 0.09546759368992126,
"grad_norm": 0.053552061319351196,
"learning_rate": 0.0029563270106553858,
"loss": 1.7567,
"step": 14500
},
{
"epoch": 0.09559927312949357,
"grad_norm": 0.07257280498743057,
"learning_rate": 0.0029561752019291376,
"loss": 1.7526,
"step": 14520
},
{
"epoch": 0.09573095256906587,
"grad_norm": 0.061258714646101,
"learning_rate": 0.002956023133725795,
"loss": 1.7556,
"step": 14540
},
{
"epoch": 0.09586263200863818,
"grad_norm": 0.05536385625600815,
"learning_rate": 0.002955870806072457,
"loss": 1.7482,
"step": 14560
},
{
"epoch": 0.09599431144821048,
"grad_norm": 0.05093999579548836,
"learning_rate": 0.002955718218996265,
"loss": 1.7564,
"step": 14580
},
{
"epoch": 0.09612599088778279,
"grad_norm": 0.05484277009963989,
"learning_rate": 0.00295556537252441,
"loss": 1.7491,
"step": 14600
},
{
"epoch": 0.09625767032735509,
"grad_norm": 0.05289185419678688,
"learning_rate": 0.002955412266684127,
"loss": 1.7516,
"step": 14620
},
{
"epoch": 0.0963893497669274,
"grad_norm": 0.05835564061999321,
"learning_rate": 0.0029552589015026986,
"loss": 1.7516,
"step": 14640
},
{
"epoch": 0.0965210292064997,
"grad_norm": 0.05260492116212845,
"learning_rate": 0.0029551052770074525,
"loss": 1.7534,
"step": 14660
},
{
"epoch": 0.096652708646072,
"grad_norm": 0.052535686641931534,
"learning_rate": 0.002954951393225764,
"loss": 1.7482,
"step": 14680
},
{
"epoch": 0.09678438808564431,
"grad_norm": 0.062096912413835526,
"learning_rate": 0.0029547972501850536,
"loss": 1.7496,
"step": 14700
},
{
"epoch": 0.09691606752521661,
"grad_norm": 0.07016194611787796,
"learning_rate": 0.0029546428479127877,
"loss": 1.7456,
"step": 14720
},
{
"epoch": 0.09704774696478892,
"grad_norm": 0.06487017124891281,
"learning_rate": 0.0029544881864364794,
"loss": 1.7443,
"step": 14740
},
{
"epoch": 0.09717942640436122,
"grad_norm": 0.060498468577861786,
"learning_rate": 0.002954333265783688,
"loss": 1.7516,
"step": 14760
},
{
"epoch": 0.09731110584393353,
"grad_norm": 0.0497431606054306,
"learning_rate": 0.0029541780859820197,
"loss": 1.7635,
"step": 14780
},
{
"epoch": 0.09744278528350583,
"grad_norm": 0.06207452341914177,
"learning_rate": 0.002954022647059125,
"loss": 1.7834,
"step": 14800
},
{
"epoch": 0.09757446472307814,
"grad_norm": 0.06484688818454742,
"learning_rate": 0.002953866949042703,
"loss": 1.7779,
"step": 14820
},
{
"epoch": 0.09770614416265044,
"grad_norm": 0.06074841320514679,
"learning_rate": 0.002953710991960496,
"loss": 1.7828,
"step": 14840
},
{
"epoch": 0.09783782360222275,
"grad_norm": 0.05373964086174965,
"learning_rate": 0.0029535547758402954,
"loss": 1.7808,
"step": 14860
},
{
"epoch": 0.09796950304179505,
"grad_norm": 0.06373169273138046,
"learning_rate": 0.002953398300709937,
"loss": 1.7843,
"step": 14880
},
{
"epoch": 0.09810118248136736,
"grad_norm": 0.05869118869304657,
"learning_rate": 0.0029532415665973035,
"loss": 1.7826,
"step": 14900
},
{
"epoch": 0.09823286192093966,
"grad_norm": 0.05736270919442177,
"learning_rate": 0.002953084573530323,
"loss": 1.774,
"step": 14920
},
{
"epoch": 0.09836454136051197,
"grad_norm": 0.07032917439937592,
"learning_rate": 0.0029529273215369704,
"loss": 1.7702,
"step": 14940
},
{
"epoch": 0.09849622080008427,
"grad_norm": 0.0598934143781662,
"learning_rate": 0.002952769810645267,
"loss": 1.7708,
"step": 14960
},
{
"epoch": 0.09862790023965658,
"grad_norm": 0.06163979694247246,
"learning_rate": 0.0029526120408832793,
"loss": 1.7771,
"step": 14980
},
{
"epoch": 0.09875957967922888,
"grad_norm": 0.055272020399570465,
"learning_rate": 0.002952454012279121,
"loss": 1.7675,
"step": 15000
},
{
"epoch": 0.09875957967922888,
"eval_loss": 1.6859747171401978,
"eval_runtime": 68.5865,
"eval_samples_per_second": 14.58,
"eval_steps_per_second": 14.58,
"step": 15000
},
{
"epoch": 0.09889125911880119,
"grad_norm": 0.06086422875523567,
"learning_rate": 0.0029522957248609505,
"loss": 1.7656,
"step": 15020
},
{
"epoch": 0.09902293855837349,
"grad_norm": 0.061683736741542816,
"learning_rate": 0.0029521371786569743,
"loss": 1.7571,
"step": 15040
},
{
"epoch": 0.0991546179979458,
"grad_norm": 0.0584699846804142,
"learning_rate": 0.0029519783736954427,
"loss": 1.7654,
"step": 15060
},
{
"epoch": 0.0992862974375181,
"grad_norm": 0.052420806139707565,
"learning_rate": 0.002951819310004654,
"loss": 1.764,
"step": 15080
},
{
"epoch": 0.0994179768770904,
"grad_norm": 0.0528109036386013,
"learning_rate": 0.0029516599876129516,
"loss": 1.7611,
"step": 15100
},
{
"epoch": 0.09954965631666271,
"grad_norm": 0.061885856091976166,
"learning_rate": 0.0029515004065487254,
"loss": 1.7628,
"step": 15120
},
{
"epoch": 0.09968133575623501,
"grad_norm": 0.04771438241004944,
"learning_rate": 0.0029513405668404116,
"loss": 1.7652,
"step": 15140
},
{
"epoch": 0.09981301519580732,
"grad_norm": 0.05954625830054283,
"learning_rate": 0.0029511804685164915,
"loss": 1.7554,
"step": 15160
},
{
"epoch": 0.09994469463537964,
"grad_norm": 0.05653547868132591,
"learning_rate": 0.002951020111605494,
"loss": 1.7607,
"step": 15180
},
{
"epoch": 0.10007637407495194,
"grad_norm": 0.05563562363386154,
"learning_rate": 0.0029508594961359922,
"loss": 1.759,
"step": 15200
},
{
"epoch": 0.10020805351452425,
"grad_norm": 0.07335685193538666,
"learning_rate": 0.002950698622136607,
"loss": 1.7543,
"step": 15220
},
{
"epoch": 0.10033973295409655,
"grad_norm": 0.06355411559343338,
"learning_rate": 0.0029505374896360045,
"loss": 1.7564,
"step": 15240
},
{
"epoch": 0.10047141239366886,
"grad_norm": 0.05546756461262703,
"learning_rate": 0.0029503760986628975,
"loss": 1.7522,
"step": 15260
},
{
"epoch": 0.10060309183324116,
"grad_norm": 0.058881357312202454,
"learning_rate": 0.002950214449246043,
"loss": 1.7544,
"step": 15280
},
{
"epoch": 0.10073477127281347,
"grad_norm": 0.06903751194477081,
"learning_rate": 0.0029500525414142475,
"loss": 1.7531,
"step": 15300
},
{
"epoch": 0.10086645071238577,
"grad_norm": 0.053250331431627274,
"learning_rate": 0.00294989037519636,
"loss": 1.753,
"step": 15320
},
{
"epoch": 0.10099813015195808,
"grad_norm": 0.059820231050252914,
"learning_rate": 0.002949727950621277,
"loss": 1.7506,
"step": 15340
},
{
"epoch": 0.10112980959153038,
"grad_norm": 0.06770730763673782,
"learning_rate": 0.0029495652677179423,
"loss": 1.76,
"step": 15360
},
{
"epoch": 0.10126148903110269,
"grad_norm": 0.0625774934887886,
"learning_rate": 0.0029494023265153432,
"loss": 1.7919,
"step": 15380
},
{
"epoch": 0.10139316847067499,
"grad_norm": 0.06113676354289055,
"learning_rate": 0.002949239127042515,
"loss": 1.814,
"step": 15400
},
{
"epoch": 0.1015248479102473,
"grad_norm": 0.06288577616214752,
"learning_rate": 0.002949075669328538,
"loss": 1.8281,
"step": 15420
},
{
"epoch": 0.1016565273498196,
"grad_norm": 0.05384008586406708,
"learning_rate": 0.0029489119534025394,
"loss": 1.8323,
"step": 15440
},
{
"epoch": 0.1017882067893919,
"grad_norm": 0.06467036157846451,
"learning_rate": 0.002948747979293692,
"loss": 1.8343,
"step": 15460
},
{
"epoch": 0.10191988622896421,
"grad_norm": 0.05992506816983223,
"learning_rate": 0.0029485837470312128,
"loss": 1.8315,
"step": 15480
},
{
"epoch": 0.10205156566853651,
"grad_norm": 0.054823681712150574,
"learning_rate": 0.002948419256644369,
"loss": 1.8361,
"step": 15500
},
{
"epoch": 0.10218324510810882,
"grad_norm": 0.07598422467708588,
"learning_rate": 0.002948254508162469,
"loss": 1.8395,
"step": 15520
},
{
"epoch": 0.10231492454768112,
"grad_norm": 0.060086604207754135,
"learning_rate": 0.002948089501614871,
"loss": 1.8341,
"step": 15540
},
{
"epoch": 0.10244660398725343,
"grad_norm": 0.05407283455133438,
"learning_rate": 0.0029479242370309766,
"loss": 1.8277,
"step": 15560
},
{
"epoch": 0.10257828342682573,
"grad_norm": 0.057680752128362656,
"learning_rate": 0.0029477587144402357,
"loss": 1.8196,
"step": 15580
},
{
"epoch": 0.10270996286639804,
"grad_norm": 0.0544477254152298,
"learning_rate": 0.0029475929338721417,
"loss": 1.8108,
"step": 15600
},
{
"epoch": 0.10284164230597034,
"grad_norm": 0.054894376546144485,
"learning_rate": 0.002947426895356236,
"loss": 1.8139,
"step": 15620
},
{
"epoch": 0.10297332174554265,
"grad_norm": 0.061300814151763916,
"learning_rate": 0.0029472605989221043,
"loss": 1.8116,
"step": 15640
},
{
"epoch": 0.10310500118511495,
"grad_norm": 0.07517964392900467,
"learning_rate": 0.00294709404459938,
"loss": 1.806,
"step": 15660
},
{
"epoch": 0.10323668062468726,
"grad_norm": 0.06433480978012085,
"learning_rate": 0.0029469272324177415,
"loss": 1.8092,
"step": 15680
},
{
"epoch": 0.10336836006425956,
"grad_norm": 0.05521683767437935,
"learning_rate": 0.0029467601624069122,
"loss": 1.814,
"step": 15700
},
{
"epoch": 0.10350003950383187,
"grad_norm": 0.0895058736205101,
"learning_rate": 0.002946592834596663,
"loss": 1.81,
"step": 15720
},
{
"epoch": 0.10363171894340417,
"grad_norm": 0.0530746690928936,
"learning_rate": 0.0029464252490168114,
"loss": 1.8098,
"step": 15740
},
{
"epoch": 0.10376339838297648,
"grad_norm": 0.05384887382388115,
"learning_rate": 0.0029462574056972174,
"loss": 1.8097,
"step": 15760
},
{
"epoch": 0.10389507782254878,
"grad_norm": 0.05644648149609566,
"learning_rate": 0.002946089304667791,
"loss": 1.8032,
"step": 15780
},
{
"epoch": 0.10402675726212109,
"grad_norm": 0.06337836384773254,
"learning_rate": 0.002945920945958485,
"loss": 1.7987,
"step": 15800
},
{
"epoch": 0.10415843670169339,
"grad_norm": 0.05301804468035698,
"learning_rate": 0.0029457523295993,
"loss": 1.7936,
"step": 15820
},
{
"epoch": 0.10429011614126571,
"grad_norm": 0.0584891214966774,
"learning_rate": 0.002945583455620282,
"loss": 1.7933,
"step": 15840
},
{
"epoch": 0.10442179558083801,
"grad_norm": 0.058483339846134186,
"learning_rate": 0.0029454143240515225,
"loss": 1.7977,
"step": 15860
},
{
"epoch": 0.10455347502041032,
"grad_norm": 0.057218778878450394,
"learning_rate": 0.0029452449349231594,
"loss": 1.7886,
"step": 15880
},
{
"epoch": 0.10468515445998262,
"grad_norm": 0.0614253394305706,
"learning_rate": 0.0029450752882653757,
"loss": 1.7898,
"step": 15900
},
{
"epoch": 0.10481683389955493,
"grad_norm": 0.05331398919224739,
"learning_rate": 0.0029449053841084016,
"loss": 1.7881,
"step": 15920
},
{
"epoch": 0.10494851333912723,
"grad_norm": 0.05099445581436157,
"learning_rate": 0.002944735222482512,
"loss": 1.7937,
"step": 15940
},
{
"epoch": 0.10508019277869954,
"grad_norm": 0.05356656014919281,
"learning_rate": 0.0029445648034180294,
"loss": 1.7943,
"step": 15960
},
{
"epoch": 0.10521187221827184,
"grad_norm": 0.07416883111000061,
"learning_rate": 0.0029443941269453188,
"loss": 1.8186,
"step": 15980
},
{
"epoch": 0.10534355165784415,
"grad_norm": 0.05611014366149902,
"learning_rate": 0.002944223193094795,
"loss": 1.8195,
"step": 16000
},
{
"epoch": 0.10534355165784415,
"eval_loss": 1.753896713256836,
"eval_runtime": 68.3324,
"eval_samples_per_second": 14.634,
"eval_steps_per_second": 14.634,
"step": 16000
},
{
"epoch": 0.00013167943957230517,
"grad_norm": 0.06669767946004868,
"learning_rate": 0.0029440520018969153,
"loss": 1.9527,
"step": 16020
},
{
"epoch": 0.00026335887914461035,
"grad_norm": 0.05156511813402176,
"learning_rate": 0.0029438805533821863,
"loss": 1.9455,
"step": 16040
},
{
"epoch": 0.00039503831871691555,
"grad_norm": 0.05357939004898071,
"learning_rate": 0.0029437088475811565,
"loss": 1.9429,
"step": 16060
},
{
"epoch": 0.0005267177582892207,
"grad_norm": 0.05948431417346001,
"learning_rate": 0.002943536884524424,
"loss": 1.9276,
"step": 16080
},
{
"epoch": 0.0006583971978615259,
"grad_norm": 0.05270468071103096,
"learning_rate": 0.00294336466424263,
"loss": 1.925,
"step": 16100
},
{
"epoch": 0.0007900766374338311,
"grad_norm": 0.05456703528761864,
"learning_rate": 0.002943192186766463,
"loss": 1.9325,
"step": 16120
},
{
"epoch": 0.0009217560770061363,
"grad_norm": 0.056205980479717255,
"learning_rate": 0.0029430194521266563,
"loss": 1.923,
"step": 16140
},
{
"epoch": 0.0010534355165784414,
"grad_norm": 0.052037931978702545,
"learning_rate": 0.002942846460353991,
"loss": 1.925,
"step": 16160
},
{
"epoch": 0.0011851149561507466,
"grad_norm": 0.05397897586226463,
"learning_rate": 0.0029426732114792914,
"loss": 1.9119,
"step": 16180
},
{
"epoch": 0.0013167943957230518,
"grad_norm": 0.06542910635471344,
"learning_rate": 0.0029424997055334293,
"loss": 1.9183,
"step": 16200
},
{
"epoch": 0.001448473835295357,
"grad_norm": 0.07107926905155182,
"learning_rate": 0.002942325942547322,
"loss": 1.917,
"step": 16220
},
{
"epoch": 0.0015801532748676622,
"grad_norm": 0.051881249994039536,
"learning_rate": 0.0029421519225519316,
"loss": 1.905,
"step": 16240
},
{
"epoch": 0.0017118327144399674,
"grad_norm": 0.06571921706199646,
"learning_rate": 0.0029419776455782685,
"loss": 1.9101,
"step": 16260
},
{
"epoch": 0.0018435121540122726,
"grad_norm": 0.08709180355072021,
"learning_rate": 0.0029418031116573854,
"loss": 1.9145,
"step": 16280
},
{
"epoch": 0.0019751915935845776,
"grad_norm": 0.05184926837682724,
"learning_rate": 0.0029416283208203845,
"loss": 1.9066,
"step": 16300
},
{
"epoch": 0.002106871033156883,
"grad_norm": 0.06952713429927826,
"learning_rate": 0.0029414532730984103,
"loss": 1.9042,
"step": 16320
},
{
"epoch": 0.002238550472729188,
"grad_norm": 0.06200730428099632,
"learning_rate": 0.002941277968522656,
"loss": 1.9042,
"step": 16340
},
{
"epoch": 0.002370229912301493,
"grad_norm": 0.06455907970666885,
"learning_rate": 0.0029411024071243587,
"loss": 1.8952,
"step": 16360
},
{
"epoch": 0.0025019093518737984,
"grad_norm": 0.051165301352739334,
"learning_rate": 0.0029409265889348015,
"loss": 1.8987,
"step": 16380
},
{
"epoch": 0.0026335887914461036,
"grad_norm": 0.0553780272603035,
"learning_rate": 0.0029407505139853137,
"loss": 1.9017,
"step": 16400
},
{
"epoch": 0.002765268231018409,
"grad_norm": 0.06370244920253754,
"learning_rate": 0.002940574182307271,
"loss": 1.8952,
"step": 16420
},
{
"epoch": 0.002896947670590714,
"grad_norm": 0.05009014904499054,
"learning_rate": 0.0029403975939320936,
"loss": 1.9018,
"step": 16440
},
{
"epoch": 0.003028627110163019,
"grad_norm": 0.053404245525598526,
"learning_rate": 0.0029402207488912475,
"loss": 1.895,
"step": 16460
},
{
"epoch": 0.0031603065497353244,
"grad_norm": 0.060919389128685,
"learning_rate": 0.0029400436472162453,
"loss": 1.8967,
"step": 16480
},
{
"epoch": 0.0032919859893076296,
"grad_norm": 0.05715464800596237,
"learning_rate": 0.002939866288938645,
"loss": 1.9042,
"step": 16500
},
{
"epoch": 0.003423665428879935,
"grad_norm": 0.07242151349782944,
"learning_rate": 0.0029396886740900496,
"loss": 1.889,
"step": 16520
},
{
"epoch": 0.00355534486845224,
"grad_norm": 0.07230902463197708,
"learning_rate": 0.0029395108027021094,
"loss": 1.8924,
"step": 16540
},
{
"epoch": 0.0036870243080245452,
"grad_norm": 0.05646587163209915,
"learning_rate": 0.002939332674806519,
"loss": 1.8873,
"step": 16560
},
{
"epoch": 0.0038187037475968504,
"grad_norm": 0.06602409482002258,
"learning_rate": 0.002939154290435019,
"loss": 1.8926,
"step": 16580
},
{
"epoch": 0.003950383187169155,
"grad_norm": 0.051282357424497604,
"learning_rate": 0.002938975649619396,
"loss": 1.9128,
"step": 16600
},
{
"epoch": 0.004082062626741461,
"grad_norm": 0.04802711680531502,
"learning_rate": 0.002938796752391482,
"loss": 1.9163,
"step": 16620
},
{
"epoch": 0.004213742066313766,
"grad_norm": 0.05548110231757164,
"learning_rate": 0.002938617598783155,
"loss": 1.9177,
"step": 16640
},
{
"epoch": 0.004345421505886071,
"grad_norm": 0.06551088392734528,
"learning_rate": 0.002938438188826339,
"loss": 1.9084,
"step": 16660
},
{
"epoch": 0.004477100945458376,
"grad_norm": 0.051025088876485825,
"learning_rate": 0.002938258522553002,
"loss": 1.9111,
"step": 16680
},
{
"epoch": 0.004608780385030682,
"grad_norm": 0.06420248001813889,
"learning_rate": 0.00293807859999516,
"loss": 1.9021,
"step": 16700
},
{
"epoch": 0.004740459824602986,
"grad_norm": 0.05957198888063431,
"learning_rate": 0.0029378984211848734,
"loss": 1.9114,
"step": 16720
},
{
"epoch": 0.004872139264175292,
"grad_norm": 0.05393804982304573,
"learning_rate": 0.002937717986154248,
"loss": 1.9018,
"step": 16740
},
{
"epoch": 0.005003818703747597,
"grad_norm": 0.052903495728969574,
"learning_rate": 0.0029375372949354355,
"loss": 1.9099,
"step": 16760
},
{
"epoch": 0.0051354981433199024,
"grad_norm": 0.0786515399813652,
"learning_rate": 0.0029373563475606343,
"loss": 1.8988,
"step": 16780
},
{
"epoch": 0.005267177582892207,
"grad_norm": 0.05307811498641968,
"learning_rate": 0.002937175144062087,
"loss": 1.901,
"step": 16800
},
{
"epoch": 0.005398857022464512,
"grad_norm": 0.07106801867485046,
"learning_rate": 0.0029369936844720825,
"loss": 1.8994,
"step": 16820
},
{
"epoch": 0.005530536462036818,
"grad_norm": 0.05467914044857025,
"learning_rate": 0.0029368119688229547,
"loss": 1.8971,
"step": 16840
},
{
"epoch": 0.005662215901609122,
"grad_norm": 0.07325299084186554,
"learning_rate": 0.0029366299971470846,
"loss": 1.8895,
"step": 16860
},
{
"epoch": 0.005793895341181428,
"grad_norm": 0.05642605945467949,
"learning_rate": 0.002936447769476897,
"loss": 1.8979,
"step": 16880
},
{
"epoch": 0.005925574780753733,
"grad_norm": 0.05529412254691124,
"learning_rate": 0.0029362652858448642,
"loss": 1.8891,
"step": 16900
},
{
"epoch": 0.006057254220326038,
"grad_norm": 0.06359060108661652,
"learning_rate": 0.0029360825462835024,
"loss": 1.8841,
"step": 16920
},
{
"epoch": 0.006188933659898343,
"grad_norm": 0.06403638422489166,
"learning_rate": 0.002935899550825374,
"loss": 1.8846,
"step": 16940
},
{
"epoch": 0.006320613099470649,
"grad_norm": 0.06129438802599907,
"learning_rate": 0.0029357162995030882,
"loss": 1.8845,
"step": 16960
},
{
"epoch": 0.006452292539042954,
"grad_norm": 0.059139031916856766,
"learning_rate": 0.002935532792349297,
"loss": 1.8841,
"step": 16980
},
{
"epoch": 0.006583971978615259,
"grad_norm": 0.056415166705846786,
"learning_rate": 0.002935349029396701,
"loss": 1.8768,
"step": 17000
},
{
"epoch": 0.006583971978615259,
"eval_loss": 1.7990331649780273,
"eval_runtime": 68.3369,
"eval_samples_per_second": 14.633,
"eval_steps_per_second": 14.633,
"step": 17000
},
{
"epoch": 0.006715651418187564,
"grad_norm": 0.05324932560324669,
"learning_rate": 0.002935165010678045,
"loss": 1.877,
"step": 17020
},
{
"epoch": 0.00684733085775987,
"grad_norm": 0.09261898696422577,
"learning_rate": 0.0029349807362261185,
"loss": 1.8822,
"step": 17040
},
{
"epoch": 0.006979010297332174,
"grad_norm": 0.05834802985191345,
"learning_rate": 0.0029347962060737583,
"loss": 1.8869,
"step": 17060
},
{
"epoch": 0.00711068973690448,
"grad_norm": 0.058308567851781845,
"learning_rate": 0.0029346114202538458,
"loss": 1.8808,
"step": 17080
},
{
"epoch": 0.007242369176476785,
"grad_norm": 0.06321283429861069,
"learning_rate": 0.0029344263787993087,
"loss": 1.88,
"step": 17100
},
{
"epoch": 0.0073740486160490904,
"grad_norm": 0.05077283829450607,
"learning_rate": 0.0029342410817431185,
"loss": 1.8774,
"step": 17120
},
{
"epoch": 0.007505728055621395,
"grad_norm": 0.06091293692588806,
"learning_rate": 0.0029340555291182944,
"loss": 1.8779,
"step": 17140
},
{
"epoch": 0.007637407495193701,
"grad_norm": 0.06410450488328934,
"learning_rate": 0.0029338697209579,
"loss": 1.8789,
"step": 17160
},
{
"epoch": 0.007769086934766006,
"grad_norm": 0.08083081990480423,
"learning_rate": 0.002933683657295044,
"loss": 1.899,
"step": 17180
},
{
"epoch": 0.00790076637433831,
"grad_norm": 0.06501522660255432,
"learning_rate": 0.002933497338162883,
"loss": 1.9053,
"step": 17200
},
{
"epoch": 0.008032445813910615,
"grad_norm": 0.048091478645801544,
"learning_rate": 0.0029333107635946152,
"loss": 1.9089,
"step": 17220
},
{
"epoch": 0.008164125253482922,
"grad_norm": 0.053573913872241974,
"learning_rate": 0.0029331239336234873,
"loss": 1.9014,
"step": 17240
},
{
"epoch": 0.008295804693055226,
"grad_norm": 0.07217760384082794,
"learning_rate": 0.0029329368482827905,
"loss": 1.9048,
"step": 17260
},
{
"epoch": 0.008427484132627531,
"grad_norm": 0.053729306906461716,
"learning_rate": 0.0029327495076058624,
"loss": 1.8983,
"step": 17280
},
{
"epoch": 0.008559163572199836,
"grad_norm": 0.05567470192909241,
"learning_rate": 0.002932561911626085,
"loss": 1.8935,
"step": 17300
},
{
"epoch": 0.008690843011772142,
"grad_norm": 0.06024245545268059,
"learning_rate": 0.002932374060376886,
"loss": 1.8916,
"step": 17320
},
{
"epoch": 0.008822522451344447,
"grad_norm": 0.05578263849020004,
"learning_rate": 0.0029321859538917394,
"loss": 1.8964,
"step": 17340
},
{
"epoch": 0.008954201890916752,
"grad_norm": 0.0536380261182785,
"learning_rate": 0.0029319975922041633,
"loss": 1.8874,
"step": 17360
},
{
"epoch": 0.009085881330489057,
"grad_norm": 0.04501722753047943,
"learning_rate": 0.002931808975347722,
"loss": 1.8824,
"step": 17380
},
{
"epoch": 0.009217560770061363,
"grad_norm": 0.06172627955675125,
"learning_rate": 0.0029316201033560262,
"loss": 1.8865,
"step": 17400
},
{
"epoch": 0.009349240209633668,
"grad_norm": 0.05938473343849182,
"learning_rate": 0.00293143097626273,
"loss": 1.8845,
"step": 17420
},
{
"epoch": 0.009480919649205973,
"grad_norm": 0.06107376888394356,
"learning_rate": 0.0029312415941015347,
"loss": 1.8892,
"step": 17440
},
{
"epoch": 0.009612599088778278,
"grad_norm": 0.05630321800708771,
"learning_rate": 0.0029310519569061867,
"loss": 1.885,
"step": 17460
},
{
"epoch": 0.009744278528350584,
"grad_norm": 0.05061402544379234,
"learning_rate": 0.0029308620647104772,
"loss": 1.8818,
"step": 17480
},
{
"epoch": 0.009875957967922889,
"grad_norm": 0.059643711894750595,
"learning_rate": 0.0029306719175482437,
"loss": 1.877,
"step": 17500
},
{
"epoch": 0.010007637407495194,
"grad_norm": 0.060052718967199326,
"learning_rate": 0.0029304815154533683,
"loss": 1.8752,
"step": 17520
},
{
"epoch": 0.010139316847067498,
"grad_norm": 0.0526292622089386,
"learning_rate": 0.002930290858459779,
"loss": 1.8804,
"step": 17540
},
{
"epoch": 0.010270996286639805,
"grad_norm": 0.08102289587259293,
"learning_rate": 0.0029300999466014494,
"loss": 1.8775,
"step": 17560
},
{
"epoch": 0.01040267572621211,
"grad_norm": 0.07066734880208969,
"learning_rate": 0.0029299087799123974,
"loss": 1.8757,
"step": 17580
},
{
"epoch": 0.010534355165784414,
"grad_norm": 0.08068786561489105,
"learning_rate": 0.002929717358426688,
"loss": 1.8798,
"step": 17600
},
{
"epoch": 0.01066603460535672,
"grad_norm": 0.06165233626961708,
"learning_rate": 0.0029295256821784306,
"loss": 1.8741,
"step": 17620
},
{
"epoch": 0.010797714044929024,
"grad_norm": 0.05444507673382759,
"learning_rate": 0.0029293337512017797,
"loss": 1.8754,
"step": 17640
},
{
"epoch": 0.01092939348450133,
"grad_norm": 0.06841527670621872,
"learning_rate": 0.002929141565530937,
"loss": 1.8747,
"step": 17660
},
{
"epoch": 0.011061072924073635,
"grad_norm": 0.06230770796537399,
"learning_rate": 0.0029289491252001464,
"loss": 1.8765,
"step": 17680
},
{
"epoch": 0.01119275236364594,
"grad_norm": 0.07215554267168045,
"learning_rate": 0.0029287564302437,
"loss": 1.8755,
"step": 17700
},
{
"epoch": 0.011324431803218245,
"grad_norm": 0.05525139719247818,
"learning_rate": 0.002928563480695934,
"loss": 1.8625,
"step": 17720
},
{
"epoch": 0.011456111242790551,
"grad_norm": 0.08375394344329834,
"learning_rate": 0.0029283702765912304,
"loss": 1.8653,
"step": 17740
},
{
"epoch": 0.011587790682362856,
"grad_norm": 0.07031811773777008,
"learning_rate": 0.0029281768179640166,
"loss": 1.8788,
"step": 17760
},
{
"epoch": 0.01171947012193516,
"grad_norm": 0.07093445956707001,
"learning_rate": 0.0029279831048487645,
"loss": 1.8865,
"step": 17780
},
{
"epoch": 0.011851149561507466,
"grad_norm": 0.07754283398389816,
"learning_rate": 0.0029277891372799926,
"loss": 1.8915,
"step": 17800
},
{
"epoch": 0.011982829001079772,
"grad_norm": 0.06764809042215347,
"learning_rate": 0.002927594915292264,
"loss": 1.906,
"step": 17820
},
{
"epoch": 0.012114508440652077,
"grad_norm": 0.05239294841885567,
"learning_rate": 0.0029274004389201872,
"loss": 1.8853,
"step": 17840
},
{
"epoch": 0.012246187880224382,
"grad_norm": 0.060666222125291824,
"learning_rate": 0.002927205708198416,
"loss": 1.8856,
"step": 17860
},
{
"epoch": 0.012377867319796686,
"grad_norm": 0.05473129451274872,
"learning_rate": 0.00292701072316165,
"loss": 1.8849,
"step": 17880
},
{
"epoch": 0.012509546759368993,
"grad_norm": 0.054005883634090424,
"learning_rate": 0.0029268154838446338,
"loss": 1.8877,
"step": 17900
},
{
"epoch": 0.012641226198941298,
"grad_norm": 0.07338313013315201,
"learning_rate": 0.0029266199902821563,
"loss": 1.8815,
"step": 17920
},
{
"epoch": 0.012772905638513602,
"grad_norm": 0.06305193156003952,
"learning_rate": 0.002926424242509054,
"loss": 1.8775,
"step": 17940
},
{
"epoch": 0.012904585078085907,
"grad_norm": 0.06329913437366486,
"learning_rate": 0.0029262282405602066,
"loss": 1.8759,
"step": 17960
},
{
"epoch": 0.013036264517658214,
"grad_norm": 0.08256923407316208,
"learning_rate": 0.0029260319844705398,
"loss": 1.8779,
"step": 17980
},
{
"epoch": 0.013167943957230518,
"grad_norm": 0.0697188749909401,
"learning_rate": 0.002925835474275025,
"loss": 1.8799,
"step": 18000
},
{
"epoch": 0.013167943957230518,
"eval_loss": 1.8294225931167603,
"eval_runtime": 65.8499,
"eval_samples_per_second": 15.186,
"eval_steps_per_second": 15.186,
"step": 18000
},
{
"epoch": 0.013299623396802823,
"grad_norm": 0.05664549395442009,
"learning_rate": 0.002925638710008678,
"loss": 1.8665,
"step": 18020
},
{
"epoch": 0.013431302836375128,
"grad_norm": 0.063201904296875,
"learning_rate": 0.002925441691706561,
"loss": 1.875,
"step": 18040
},
{
"epoch": 0.013562982275947433,
"grad_norm": 0.05750538036227226,
"learning_rate": 0.0029252444194037804,
"loss": 1.86,
"step": 18060
},
{
"epoch": 0.01369466171551974,
"grad_norm": 0.073476642370224,
"learning_rate": 0.0029250468931354885,
"loss": 1.8567,
"step": 18080
},
{
"epoch": 0.013826341155092044,
"grad_norm": 0.05800202861428261,
"learning_rate": 0.002924849112936883,
"loss": 1.8669,
"step": 18100
},
{
"epoch": 0.013958020594664349,
"grad_norm": 0.053366515785455704,
"learning_rate": 0.002924651078843206,
"loss": 1.8683,
"step": 18120
},
{
"epoch": 0.014089700034236654,
"grad_norm": 0.06024957075715065,
"learning_rate": 0.0029244527908897453,
"loss": 1.8654,
"step": 18140
},
{
"epoch": 0.01422137947380896,
"grad_norm": 0.06702018529176712,
"learning_rate": 0.0029242542491118343,
"loss": 1.8669,
"step": 18160
},
{
"epoch": 0.014353058913381265,
"grad_norm": 0.050999585539102554,
"learning_rate": 0.002924055453544852,
"loss": 1.863,
"step": 18180
},
{
"epoch": 0.01448473835295357,
"grad_norm": 0.05390724167227745,
"learning_rate": 0.0029238564042242204,
"loss": 1.8686,
"step": 18200
},
{
"epoch": 0.014616417792525874,
"grad_norm": 0.08430622518062592,
"learning_rate": 0.0029236571011854095,
"loss": 1.8591,
"step": 18220
},
{
"epoch": 0.014748097232098181,
"grad_norm": 0.07103120535612106,
"learning_rate": 0.0029234575444639327,
"loss": 1.8687,
"step": 18240
},
{
"epoch": 0.014879776671670486,
"grad_norm": 0.0677858293056488,
"learning_rate": 0.0029232577340953495,
"loss": 1.8611,
"step": 18260
},
{
"epoch": 0.01501145611124279,
"grad_norm": 0.07199349999427795,
"learning_rate": 0.002923057670115264,
"loss": 1.8613,
"step": 18280
},
{
"epoch": 0.015143135550815095,
"grad_norm": 0.04802101105451584,
"learning_rate": 0.002922857352559326,
"loss": 1.8585,
"step": 18300
},
{
"epoch": 0.015274814990387402,
"grad_norm": 0.06592894345521927,
"learning_rate": 0.00292265678146323,
"loss": 1.8627,
"step": 18320
},
{
"epoch": 0.015406494429959706,
"grad_norm": 0.06502063572406769,
"learning_rate": 0.0029224559568627162,
"loss": 1.8542,
"step": 18340
},
{
"epoch": 0.015538173869532011,
"grad_norm": 0.08361044526100159,
"learning_rate": 0.0029222548787935696,
"loss": 1.8558,
"step": 18360
},
{
"epoch": 0.015669853309104316,
"grad_norm": 0.09134091436862946,
"learning_rate": 0.002922053547291621,
"loss": 1.8395,
"step": 18380
},
{
"epoch": 0.01580153274867662,
"grad_norm": 0.06279317289590836,
"learning_rate": 0.0029218519623927445,
"loss": 1.7925,
"step": 18400
},
{
"epoch": 0.015933212188248926,
"grad_norm": 0.05970417335629463,
"learning_rate": 0.0029216501241328616,
"loss": 1.7958,
"step": 18420
},
{
"epoch": 0.01606489162782123,
"grad_norm": 0.05772954598069191,
"learning_rate": 0.0029214480325479384,
"loss": 1.7899,
"step": 18440
},
{
"epoch": 0.01619657106739354,
"grad_norm": 0.05578155443072319,
"learning_rate": 0.002921245687673985,
"loss": 1.7772,
"step": 18460
},
{
"epoch": 0.016328250506965843,
"grad_norm": 0.05890611186623573,
"learning_rate": 0.0029210430895470576,
"loss": 1.7791,
"step": 18480
},
{
"epoch": 0.016459929946538148,
"grad_norm": 0.053837426006793976,
"learning_rate": 0.0029208402382032575,
"loss": 1.7787,
"step": 18500
},
{
"epoch": 0.016591609386110453,
"grad_norm": 0.05714136362075806,
"learning_rate": 0.002920637133678731,
"loss": 1.7725,
"step": 18520
},
{
"epoch": 0.016723288825682758,
"grad_norm": 0.06816162914037704,
"learning_rate": 0.0029204337760096693,
"loss": 1.7821,
"step": 18540
},
{
"epoch": 0.016854968265255062,
"grad_norm": 0.05500810220837593,
"learning_rate": 0.002920230165232309,
"loss": 1.77,
"step": 18560
},
{
"epoch": 0.016986647704827367,
"grad_norm": 0.05971973389387131,
"learning_rate": 0.0029200263013829312,
"loss": 1.7673,
"step": 18580
},
{
"epoch": 0.017118327144399672,
"grad_norm": 0.05585896596312523,
"learning_rate": 0.0029198221844978635,
"loss": 1.7719,
"step": 18600
},
{
"epoch": 0.01725000658397198,
"grad_norm": 0.05968007817864418,
"learning_rate": 0.0029196178146134767,
"loss": 1.7725,
"step": 18620
},
{
"epoch": 0.017381686023544285,
"grad_norm": 0.06808626651763916,
"learning_rate": 0.0029194131917661885,
"loss": 1.7704,
"step": 18640
},
{
"epoch": 0.01751336546311659,
"grad_norm": 0.057727713137865067,
"learning_rate": 0.00291920831599246,
"loss": 1.7752,
"step": 18660
},
{
"epoch": 0.017645044902688894,
"grad_norm": 0.05363877862691879,
"learning_rate": 0.0029190031873287986,
"loss": 1.7682,
"step": 18680
},
{
"epoch": 0.0177767243422612,
"grad_norm": 0.08140948414802551,
"learning_rate": 0.0029187978058117566,
"loss": 1.7621,
"step": 18700
},
{
"epoch": 0.017908403781833504,
"grad_norm": 0.05746082961559296,
"learning_rate": 0.0029185921714779306,
"loss": 1.7743,
"step": 18720
},
{
"epoch": 0.01804008322140581,
"grad_norm": 0.06933200359344482,
"learning_rate": 0.0029183862843639636,
"loss": 1.7783,
"step": 18740
},
{
"epoch": 0.018171762660978114,
"grad_norm": 0.06859739869832993,
"learning_rate": 0.0029181801445065415,
"loss": 1.7723,
"step": 18760
},
{
"epoch": 0.018303442100550422,
"grad_norm": 0.05922358110547066,
"learning_rate": 0.002917973751942397,
"loss": 1.7745,
"step": 18780
},
{
"epoch": 0.018435121540122727,
"grad_norm": 0.0643932893872261,
"learning_rate": 0.0029177671067083084,
"loss": 1.7625,
"step": 18800
},
{
"epoch": 0.01856680097969503,
"grad_norm": 0.060253337025642395,
"learning_rate": 0.002917560208841097,
"loss": 1.7739,
"step": 18820
},
{
"epoch": 0.018698480419267336,
"grad_norm": 0.06834478676319122,
"learning_rate": 0.00291735305837763,
"loss": 1.7714,
"step": 18840
},
{
"epoch": 0.01883015985883964,
"grad_norm": 0.06220484897494316,
"learning_rate": 0.00291714565535482,
"loss": 1.7794,
"step": 18860
},
{
"epoch": 0.018961839298411946,
"grad_norm": 0.059682924300432205,
"learning_rate": 0.0029169379998096245,
"loss": 1.7751,
"step": 18880
},
{
"epoch": 0.01909351873798425,
"grad_norm": 0.06003641337156296,
"learning_rate": 0.002916730091779046,
"loss": 1.7709,
"step": 18900
},
{
"epoch": 0.019225198177556555,
"grad_norm": 0.05494799092411995,
"learning_rate": 0.0029165219313001304,
"loss": 1.7704,
"step": 18920
},
{
"epoch": 0.01935687761712886,
"grad_norm": 0.05533396452665329,
"learning_rate": 0.002916313518409972,
"loss": 1.7788,
"step": 18940
},
{
"epoch": 0.019488557056701168,
"grad_norm": 0.06435955315828323,
"learning_rate": 0.0029161048531457065,
"loss": 1.8023,
"step": 18960
},
{
"epoch": 0.019620236496273473,
"grad_norm": 0.056616947054862976,
"learning_rate": 0.0029158959355445177,
"loss": 1.8187,
"step": 18980
},
{
"epoch": 0.019751915935845778,
"grad_norm": 0.05237163230776787,
"learning_rate": 0.002915686765643631,
"loss": 1.8274,
"step": 19000
},
{
"epoch": 0.019751915935845778,
"eval_loss": 1.8479809761047363,
"eval_runtime": 65.9646,
"eval_samples_per_second": 15.16,
"eval_steps_per_second": 15.16,
"step": 19000
},
{
"epoch": 0.019883595375418082,
"grad_norm": 0.06315074861049652,
"learning_rate": 0.00291547734348032,
"loss": 1.8249,
"step": 19020
},
{
"epoch": 0.020015274814990387,
"grad_norm": 0.061322640627622604,
"learning_rate": 0.002915267669091901,
"loss": 1.8305,
"step": 19040
},
{
"epoch": 0.020146954254562692,
"grad_norm": 0.06135581433773041,
"learning_rate": 0.0029150577425157355,
"loss": 1.8285,
"step": 19060
},
{
"epoch": 0.020278633694134997,
"grad_norm": 0.06242895498871803,
"learning_rate": 0.0029148475637892322,
"loss": 1.8291,
"step": 19080
},
{
"epoch": 0.0204103131337073,
"grad_norm": 0.07442411780357361,
"learning_rate": 0.002914637132949842,
"loss": 1.8167,
"step": 19100
},
{
"epoch": 0.02054199257327961,
"grad_norm": 0.07312595844268799,
"learning_rate": 0.0029144264500350616,
"loss": 1.8139,
"step": 19120
},
{
"epoch": 0.020673672012851915,
"grad_norm": 0.07727395743131638,
"learning_rate": 0.0029142155150824333,
"loss": 1.8121,
"step": 19140
},
{
"epoch": 0.02080535145242422,
"grad_norm": 0.06504666805267334,
"learning_rate": 0.0029140043281295435,
"loss": 1.8162,
"step": 19160
},
{
"epoch": 0.020937030891996524,
"grad_norm": 0.06606578081846237,
"learning_rate": 0.0029137928892140237,
"loss": 1.8141,
"step": 19180
},
{
"epoch": 0.02106871033156883,
"grad_norm": 0.07460979372262955,
"learning_rate": 0.0029135811983735504,
"loss": 1.811,
"step": 19200
},
{
"epoch": 0.021200389771141134,
"grad_norm": 0.05553029850125313,
"learning_rate": 0.002913369255645845,
"loss": 1.8122,
"step": 19220
},
{
"epoch": 0.02133206921071344,
"grad_norm": 0.1024724543094635,
"learning_rate": 0.002913157061068674,
"loss": 1.8186,
"step": 19240
},
{
"epoch": 0.021463748650285743,
"grad_norm": 0.07562136650085449,
"learning_rate": 0.002912944614679848,
"loss": 1.8238,
"step": 19260
},
{
"epoch": 0.021595428089858048,
"grad_norm": 0.054396726191043854,
"learning_rate": 0.002912731916517224,
"loss": 1.8072,
"step": 19280
},
{
"epoch": 0.021727107529430356,
"grad_norm": 0.07781907916069031,
"learning_rate": 0.0029125189666187015,
"loss": 1.8066,
"step": 19300
},
{
"epoch": 0.02185878696900266,
"grad_norm": 0.05102219805121422,
"learning_rate": 0.0029123057650222274,
"loss": 1.803,
"step": 19320
},
{
"epoch": 0.021990466408574966,
"grad_norm": 0.05836215242743492,
"learning_rate": 0.002912092311765792,
"loss": 1.8013,
"step": 19340
},
{
"epoch": 0.02212214584814727,
"grad_norm": 0.0890396237373352,
"learning_rate": 0.0029118786068874298,
"loss": 1.804,
"step": 19360
},
{
"epoch": 0.022253825287719575,
"grad_norm": 0.06296063959598541,
"learning_rate": 0.002911664650425222,
"loss": 1.7988,
"step": 19380
},
{
"epoch": 0.02238550472729188,
"grad_norm": 0.07317844778299332,
"learning_rate": 0.0029114504424172937,
"loss": 1.7993,
"step": 19400
},
{
"epoch": 0.022517184166864185,
"grad_norm": 0.061669182032346725,
"learning_rate": 0.002911235982901814,
"loss": 1.7971,
"step": 19420
},
{
"epoch": 0.02264886360643649,
"grad_norm": 0.07136490941047668,
"learning_rate": 0.002911021271916998,
"loss": 1.8064,
"step": 19440
},
{
"epoch": 0.022780543046008798,
"grad_norm": 0.05423993617296219,
"learning_rate": 0.0029108063095011063,
"loss": 1.8017,
"step": 19460
},
{
"epoch": 0.022912222485581103,
"grad_norm": 0.0703122541308403,
"learning_rate": 0.002910591095692442,
"loss": 1.7979,
"step": 19480
},
{
"epoch": 0.023043901925153407,
"grad_norm": 0.06629758328199387,
"learning_rate": 0.0029103756305293546,
"loss": 1.7959,
"step": 19500
},
{
"epoch": 0.023175581364725712,
"grad_norm": 0.06768941134214401,
"learning_rate": 0.002910159914050238,
"loss": 1.796,
"step": 19520
},
{
"epoch": 0.023307260804298017,
"grad_norm": 0.060242656618356705,
"learning_rate": 0.002909943946293531,
"loss": 1.802,
"step": 19540
},
{
"epoch": 0.02343894024387032,
"grad_norm": 0.06179652363061905,
"learning_rate": 0.0029097277272977164,
"loss": 1.8097,
"step": 19560
},
{
"epoch": 0.023570619683442626,
"grad_norm": 0.10733772069215775,
"learning_rate": 0.0029095112571013238,
"loss": 1.8088,
"step": 19580
},
{
"epoch": 0.02370229912301493,
"grad_norm": 0.07508611679077148,
"learning_rate": 0.002909294535742925,
"loss": 1.8135,
"step": 19600
},
{
"epoch": 0.023833978562587236,
"grad_norm": 0.057078372687101364,
"learning_rate": 0.0029090775632611377,
"loss": 1.811,
"step": 19620
},
{
"epoch": 0.023965658002159544,
"grad_norm": 0.06910204887390137,
"learning_rate": 0.002908860339694626,
"loss": 1.8024,
"step": 19640
},
{
"epoch": 0.02409733744173185,
"grad_norm": 0.05256013572216034,
"learning_rate": 0.0029086428650820953,
"loss": 1.8001,
"step": 19660
},
{
"epoch": 0.024229016881304154,
"grad_norm": 0.05280625820159912,
"learning_rate": 0.0029084251394622986,
"loss": 1.7961,
"step": 19680
},
{
"epoch": 0.02436069632087646,
"grad_norm": 0.07600513845682144,
"learning_rate": 0.0029082071628740323,
"loss": 1.7916,
"step": 19700
},
{
"epoch": 0.024492375760448763,
"grad_norm": 0.060011059045791626,
"learning_rate": 0.002907988935356138,
"loss": 1.7981,
"step": 19720
},
{
"epoch": 0.024624055200021068,
"grad_norm": 0.06662587076425552,
"learning_rate": 0.002907770456947501,
"loss": 1.7979,
"step": 19740
},
{
"epoch": 0.024755734639593373,
"grad_norm": 0.06288140267133713,
"learning_rate": 0.002907551727687054,
"loss": 1.7918,
"step": 19760
},
{
"epoch": 0.024887414079165678,
"grad_norm": 0.07184966653585434,
"learning_rate": 0.002907332747613771,
"loss": 1.7932,
"step": 19780
},
{
"epoch": 0.025019093518737986,
"grad_norm": 0.062474627047777176,
"learning_rate": 0.0029071135167666722,
"loss": 1.7897,
"step": 19800
},
{
"epoch": 0.02515077295831029,
"grad_norm": 0.055238522589206696,
"learning_rate": 0.0029068940351848235,
"loss": 1.7866,
"step": 19820
},
{
"epoch": 0.025282452397882595,
"grad_norm": 0.060174524784088135,
"learning_rate": 0.002906674302907334,
"loss": 1.7854,
"step": 19840
},
{
"epoch": 0.0254141318374549,
"grad_norm": 0.05686888098716736,
"learning_rate": 0.002906454319973358,
"loss": 1.7794,
"step": 19860
},
{
"epoch": 0.025545811277027205,
"grad_norm": 0.05989696830511093,
"learning_rate": 0.002906234086422094,
"loss": 1.7802,
"step": 19880
},
{
"epoch": 0.02567749071659951,
"grad_norm": 0.05739467218518257,
"learning_rate": 0.0029060136022927867,
"loss": 1.7859,
"step": 19900
},
{
"epoch": 0.025809170156171814,
"grad_norm": 0.06893962621688843,
"learning_rate": 0.0029057928676247233,
"loss": 1.7903,
"step": 19920
},
{
"epoch": 0.02594084959574412,
"grad_norm": 0.05944626033306122,
"learning_rate": 0.002905571882457237,
"loss": 1.7905,
"step": 19940
},
{
"epoch": 0.026072529035316427,
"grad_norm": 0.10011964291334152,
"learning_rate": 0.002905350646829706,
"loss": 1.7824,
"step": 19960
},
{
"epoch": 0.026204208474888732,
"grad_norm": 0.055610090494155884,
"learning_rate": 0.0029051291607815515,
"loss": 1.7803,
"step": 19980
},
{
"epoch": 0.026335887914461037,
"grad_norm": 0.061704959720373154,
"learning_rate": 0.0029049074243522404,
"loss": 1.7793,
"step": 20000
},
{
"epoch": 0.026335887914461037,
"eval_loss": 1.8498175144195557,
"eval_runtime": 65.8184,
"eval_samples_per_second": 15.193,
"eval_steps_per_second": 15.193,
"step": 20000
},
{
"epoch": 0.02646756735403334,
"grad_norm": 0.06252337247133255,
"learning_rate": 0.002904685437581285,
"loss": 1.7794,
"step": 20020
},
{
"epoch": 0.026599246793605646,
"grad_norm": 0.05822984129190445,
"learning_rate": 0.00290446320050824,
"loss": 1.7819,
"step": 20040
},
{
"epoch": 0.02673092623317795,
"grad_norm": 0.05482339486479759,
"learning_rate": 0.0029042407131727073,
"loss": 1.7867,
"step": 20060
},
{
"epoch": 0.026862605672750256,
"grad_norm": 0.05103064700961113,
"learning_rate": 0.0029040179756143316,
"loss": 1.7764,
"step": 20080
},
{
"epoch": 0.02699428511232256,
"grad_norm": 0.06983567029237747,
"learning_rate": 0.002903794987872802,
"loss": 1.779,
"step": 20100
},
{
"epoch": 0.027125964551894866,
"grad_norm": 0.06782662123441696,
"learning_rate": 0.0029035717499878537,
"loss": 1.7814,
"step": 20120
},
{
"epoch": 0.027257643991467174,
"grad_norm": 0.07617141306400299,
"learning_rate": 0.0029033482619992656,
"loss": 1.8055,
"step": 20140
},
{
"epoch": 0.02738932343103948,
"grad_norm": 0.07056764513254166,
"learning_rate": 0.002903124523946861,
"loss": 1.8267,
"step": 20160
},
{
"epoch": 0.027521002870611783,
"grad_norm": 0.05244629457592964,
"learning_rate": 0.0029029005358705085,
"loss": 1.8346,
"step": 20180
},
{
"epoch": 0.027652682310184088,
"grad_norm": 0.05634482949972153,
"learning_rate": 0.0029026762978101197,
"loss": 1.8347,
"step": 20200
},
{
"epoch": 0.027784361749756393,
"grad_norm": 0.060985077172517776,
"learning_rate": 0.0029024518098056526,
"loss": 1.8397,
"step": 20220
},
{
"epoch": 0.027916041189328698,
"grad_norm": 0.060473646968603134,
"learning_rate": 0.0029022270718971083,
"loss": 1.8363,
"step": 20240
},
{
"epoch": 0.028047720628901002,
"grad_norm": 0.05223367363214493,
"learning_rate": 0.002902002084124533,
"loss": 1.8378,
"step": 20260
},
{
"epoch": 0.028179400068473307,
"grad_norm": 0.06747066229581833,
"learning_rate": 0.0029017768465280187,
"loss": 1.8394,
"step": 20280
},
{
"epoch": 0.028311079508045615,
"grad_norm": 0.06481572240591049,
"learning_rate": 0.0029015513591476995,
"loss": 1.829,
"step": 20300
},
{
"epoch": 0.02844275894761792,
"grad_norm": 0.07189793139696121,
"learning_rate": 0.002901325622023755,
"loss": 1.8283,
"step": 20320
},
{
"epoch": 0.028574438387190225,
"grad_norm": 0.0644344687461853,
"learning_rate": 0.0029010996351964105,
"loss": 1.8265,
"step": 20340
},
{
"epoch": 0.02870611782676253,
"grad_norm": 0.06990751624107361,
"learning_rate": 0.002900873398705934,
"loss": 1.824,
"step": 20360
},
{
"epoch": 0.028837797266334834,
"grad_norm": 0.07374297082424164,
"learning_rate": 0.0029006469125926397,
"loss": 1.8223,
"step": 20380
},
{
"epoch": 0.02896947670590714,
"grad_norm": 0.08984444290399551,
"learning_rate": 0.0029004201768968838,
"loss": 1.8232,
"step": 20400
},
{
"epoch": 0.029101156145479444,
"grad_norm": 0.06562740355730057,
"learning_rate": 0.00290019319165907,
"loss": 1.8235,
"step": 20420
},
{
"epoch": 0.02923283558505175,
"grad_norm": 0.07431894540786743,
"learning_rate": 0.0028999659569196442,
"loss": 1.8141,
"step": 20440
},
{
"epoch": 0.029364515024624054,
"grad_norm": 0.057788606733083725,
"learning_rate": 0.0028997384727190976,
"loss": 1.8159,
"step": 20460
},
{
"epoch": 0.029496194464196362,
"grad_norm": 0.07726121693849564,
"learning_rate": 0.002899510739097966,
"loss": 1.8156,
"step": 20480
},
{
"epoch": 0.029627873903768667,
"grad_norm": 0.07005012780427933,
"learning_rate": 0.0028992827560968297,
"loss": 1.8172,
"step": 20500
},
{
"epoch": 0.02975955334334097,
"grad_norm": 0.06550168991088867,
"learning_rate": 0.002899054523756313,
"loss": 1.8067,
"step": 20520
},
{
"epoch": 0.029891232782913276,
"grad_norm": 0.07354078441858292,
"learning_rate": 0.002898826042117084,
"loss": 1.8109,
"step": 20540
},
{
"epoch": 0.03002291222248558,
"grad_norm": 0.06678362935781479,
"learning_rate": 0.0028985973112198573,
"loss": 1.8158,
"step": 20560
},
{
"epoch": 0.030154591662057886,
"grad_norm": 0.08662049472332001,
"learning_rate": 0.0028983683311053898,
"loss": 1.8077,
"step": 20580
},
{
"epoch": 0.03028627110163019,
"grad_norm": 0.06835264712572098,
"learning_rate": 0.0028981391018144845,
"loss": 1.8074,
"step": 20600
},
{
"epoch": 0.030417950541202495,
"grad_norm": 0.06030866131186485,
"learning_rate": 0.0028979096233879872,
"loss": 1.8096,
"step": 20620
},
{
"epoch": 0.030549629980774803,
"grad_norm": 0.07386446744203568,
"learning_rate": 0.0028976798958667885,
"loss": 1.8134,
"step": 20640
},
{
"epoch": 0.030681309420347108,
"grad_norm": 0.07323277741670609,
"learning_rate": 0.002897449919291825,
"loss": 1.8073,
"step": 20660
},
{
"epoch": 0.030812988859919413,
"grad_norm": 0.08217355608940125,
"learning_rate": 0.0028972196937040754,
"loss": 1.8044,
"step": 20680
},
{
"epoch": 0.030944668299491718,
"grad_norm": 0.06611933559179306,
"learning_rate": 0.002896989219144564,
"loss": 1.8016,
"step": 20700
},
{
"epoch": 0.031076347739064022,
"grad_norm": 0.06082133203744888,
"learning_rate": 0.0028967584956543597,
"loss": 1.7986,
"step": 20720
},
{
"epoch": 0.031208027178636327,
"grad_norm": 0.06548244506120682,
"learning_rate": 0.002896527523274575,
"loss": 1.8025,
"step": 20740
},
{
"epoch": 0.03133970661820863,
"grad_norm": 0.08356646448373795,
"learning_rate": 0.0028962963020463667,
"loss": 1.783,
"step": 20760
},
{
"epoch": 0.03147138605778094,
"grad_norm": 0.06322002410888672,
"learning_rate": 0.002896064832010937,
"loss": 1.774,
"step": 20780
},
{
"epoch": 0.03160306549735324,
"grad_norm": 0.0772123858332634,
"learning_rate": 0.002895833113209531,
"loss": 1.7628,
"step": 20800
},
{
"epoch": 0.031734744936925546,
"grad_norm": 0.0836576297879219,
"learning_rate": 0.0028956011456834395,
"loss": 1.7589,
"step": 20820
},
{
"epoch": 0.03186642437649785,
"grad_norm": 0.06800664216279984,
"learning_rate": 0.002895368929473997,
"loss": 1.7455,
"step": 20840
},
{
"epoch": 0.031998103816070156,
"grad_norm": 0.058029696345329285,
"learning_rate": 0.0028951364646225826,
"loss": 1.745,
"step": 20860
},
{
"epoch": 0.03212978325564246,
"grad_norm": 0.05537112057209015,
"learning_rate": 0.0028949037511706178,
"loss": 1.748,
"step": 20880
},
{
"epoch": 0.03226146269521477,
"grad_norm": 0.06035890802741051,
"learning_rate": 0.0028946707891595717,
"loss": 1.7463,
"step": 20900
},
{
"epoch": 0.03239314213478708,
"grad_norm": 0.06673149764537811,
"learning_rate": 0.002894437578630955,
"loss": 1.7429,
"step": 20920
},
{
"epoch": 0.03252482157435938,
"grad_norm": 0.08091327548027039,
"learning_rate": 0.0028942041196263245,
"loss": 1.7388,
"step": 20940
},
{
"epoch": 0.03265650101393169,
"grad_norm": 0.05750538781285286,
"learning_rate": 0.00289397041218728,
"loss": 1.7322,
"step": 20960
},
{
"epoch": 0.03278818045350399,
"grad_norm": 0.059635717421770096,
"learning_rate": 0.0028937364563554656,
"loss": 1.7425,
"step": 20980
},
{
"epoch": 0.032919859893076296,
"grad_norm": 0.07420338690280914,
"learning_rate": 0.002893502252172571,
"loss": 1.7369,
"step": 21000
},
{
"epoch": 0.032919859893076296,
"eval_loss": 1.7132776975631714,
"eval_runtime": 66.0009,
"eval_samples_per_second": 15.151,
"eval_steps_per_second": 15.151,
"step": 21000
},
{
"epoch": 0.0330515393326486,
"grad_norm": 0.06639964133501053,
"learning_rate": 0.0028932677996803286,
"loss": 1.7301,
"step": 21020
},
{
"epoch": 0.033183218772220906,
"grad_norm": 0.06292149424552917,
"learning_rate": 0.0028930330989205156,
"loss": 1.7371,
"step": 21040
},
{
"epoch": 0.03331489821179321,
"grad_norm": 0.07750008255243301,
"learning_rate": 0.002892798149934954,
"loss": 1.7395,
"step": 21060
},
{
"epoch": 0.033446577651365515,
"grad_norm": 0.056288789957761765,
"learning_rate": 0.0028925629527655097,
"loss": 1.7346,
"step": 21080
},
{
"epoch": 0.03357825709093782,
"grad_norm": 0.07288241386413574,
"learning_rate": 0.002892327507454092,
"loss": 1.7306,
"step": 21100
},
{
"epoch": 0.033709936530510125,
"grad_norm": 0.06977301836013794,
"learning_rate": 0.002892091814042655,
"loss": 1.7293,
"step": 21120
},
{
"epoch": 0.03384161597008243,
"grad_norm": 0.07677018642425537,
"learning_rate": 0.0028918558725731986,
"loss": 1.7334,
"step": 21140
},
{
"epoch": 0.033973295409654734,
"grad_norm": 0.06132907420396805,
"learning_rate": 0.0028916196830877637,
"loss": 1.7352,
"step": 21160
},
{
"epoch": 0.03410497484922704,
"grad_norm": 0.08819183707237244,
"learning_rate": 0.0028913832456284377,
"loss": 1.7383,
"step": 21180
},
{
"epoch": 0.034236654288799344,
"grad_norm": 0.0902981087565422,
"learning_rate": 0.0028911465602373524,
"loss": 1.7296,
"step": 21200
},
{
"epoch": 0.03436833372837165,
"grad_norm": 0.07254979014396667,
"learning_rate": 0.0028909096269566815,
"loss": 1.7314,
"step": 21220
},
{
"epoch": 0.03450001316794396,
"grad_norm": 0.08108898252248764,
"learning_rate": 0.0028906724458286456,
"loss": 1.7365,
"step": 21240
},
{
"epoch": 0.034631692607516265,
"grad_norm": 0.061406515538692474,
"learning_rate": 0.002890435016895507,
"loss": 1.7338,
"step": 21260
},
{
"epoch": 0.03476337204708857,
"grad_norm": 0.07603522390127182,
"learning_rate": 0.0028901973401995744,
"loss": 1.727,
"step": 21280
},
{
"epoch": 0.034895051486660875,
"grad_norm": 0.08022353053092957,
"learning_rate": 0.002889959415783199,
"loss": 1.7258,
"step": 21300
},
{
"epoch": 0.03502673092623318,
"grad_norm": 0.061437543481588364,
"learning_rate": 0.0028897212436887775,
"loss": 1.7416,
"step": 21320
},
{
"epoch": 0.035158410365805484,
"grad_norm": 0.07316586375236511,
"learning_rate": 0.0028894828239587494,
"loss": 1.7415,
"step": 21340
},
{
"epoch": 0.03529008980537779,
"grad_norm": 0.09495033323764801,
"learning_rate": 0.002889244156635599,
"loss": 1.7403,
"step": 21360
},
{
"epoch": 0.035421769244950094,
"grad_norm": 0.06723074615001678,
"learning_rate": 0.002889005241761854,
"loss": 1.7497,
"step": 21380
},
{
"epoch": 0.0355534486845224,
"grad_norm": 0.05688747763633728,
"learning_rate": 0.002888766079380088,
"loss": 1.7408,
"step": 21400
},
{
"epoch": 0.0356851281240947,
"grad_norm": 0.06509803235530853,
"learning_rate": 0.002888526669532917,
"loss": 1.7461,
"step": 21420
},
{
"epoch": 0.03581680756366701,
"grad_norm": 0.07571250200271606,
"learning_rate": 0.002888287012263002,
"loss": 1.7385,
"step": 21440
},
{
"epoch": 0.03594848700323931,
"grad_norm": 0.0633770301938057,
"learning_rate": 0.002888047107613047,
"loss": 1.743,
"step": 21460
},
{
"epoch": 0.03608016644281162,
"grad_norm": 0.07172537595033646,
"learning_rate": 0.0028878069556258013,
"loss": 1.7289,
"step": 21480
},
{
"epoch": 0.03621184588238392,
"grad_norm": 0.09092337638139725,
"learning_rate": 0.002887566556344058,
"loss": 1.7392,
"step": 21500
},
{
"epoch": 0.03634352532195623,
"grad_norm": 0.06401342898607254,
"learning_rate": 0.002887325909810653,
"loss": 1.7372,
"step": 21520
},
{
"epoch": 0.03647520476152853,
"grad_norm": 0.06551776826381683,
"learning_rate": 0.0028870850160684688,
"loss": 1.7221,
"step": 21540
},
{
"epoch": 0.036606884201100844,
"grad_norm": 0.08069788664579391,
"learning_rate": 0.0028868438751604294,
"loss": 1.7201,
"step": 21560
},
{
"epoch": 0.03673856364067315,
"grad_norm": 0.05819667875766754,
"learning_rate": 0.002886602487129504,
"loss": 1.7256,
"step": 21580
},
{
"epoch": 0.03687024308024545,
"grad_norm": 0.06299937516450882,
"learning_rate": 0.0028863608520187066,
"loss": 1.7216,
"step": 21600
},
{
"epoch": 0.03700192251981776,
"grad_norm": 0.08698736876249313,
"learning_rate": 0.002886118969871093,
"loss": 1.7208,
"step": 21620
},
{
"epoch": 0.03713360195939006,
"grad_norm": 0.07046283036470413,
"learning_rate": 0.0028858768407297656,
"loss": 1.7141,
"step": 21640
},
{
"epoch": 0.03726528139896237,
"grad_norm": 0.06260740756988525,
"learning_rate": 0.0028856344646378687,
"loss": 1.7243,
"step": 21660
},
{
"epoch": 0.03739696083853467,
"grad_norm": 0.0720597505569458,
"learning_rate": 0.0028853918416385928,
"loss": 1.7195,
"step": 21680
},
{
"epoch": 0.03752864027810698,
"grad_norm": 0.07073231786489487,
"learning_rate": 0.0028851489717751696,
"loss": 1.7241,
"step": 21700
},
{
"epoch": 0.03766031971767928,
"grad_norm": 0.05944892391562462,
"learning_rate": 0.0028849058550908767,
"loss": 1.7201,
"step": 21720
},
{
"epoch": 0.037791999157251586,
"grad_norm": 0.06408489495515823,
"learning_rate": 0.0028846624916290357,
"loss": 1.7228,
"step": 21740
},
{
"epoch": 0.03792367859682389,
"grad_norm": 0.07245621085166931,
"learning_rate": 0.002884418881433012,
"loss": 1.7191,
"step": 21760
},
{
"epoch": 0.038055358036396196,
"grad_norm": 0.06913050264120102,
"learning_rate": 0.0028841750245462137,
"loss": 1.7228,
"step": 21780
},
{
"epoch": 0.0381870374759685,
"grad_norm": 0.057451095432043076,
"learning_rate": 0.002883930921012094,
"loss": 1.7163,
"step": 21800
},
{
"epoch": 0.038318716915540806,
"grad_norm": 0.07231597602367401,
"learning_rate": 0.002883686570874151,
"loss": 1.7143,
"step": 21820
},
{
"epoch": 0.03845039635511311,
"grad_norm": 0.08483259379863739,
"learning_rate": 0.0028834419741759244,
"loss": 1.7216,
"step": 21840
},
{
"epoch": 0.038582075794685415,
"grad_norm": 0.0528041310608387,
"learning_rate": 0.0028831971309610004,
"loss": 1.7174,
"step": 21860
},
{
"epoch": 0.03871375523425772,
"grad_norm": 0.06268829107284546,
"learning_rate": 0.0028829520412730065,
"loss": 1.721,
"step": 21880
},
{
"epoch": 0.03884543467383003,
"grad_norm": 0.08661678433418274,
"learning_rate": 0.0028827067051556163,
"loss": 1.7196,
"step": 21900
},
{
"epoch": 0.038977114113402336,
"grad_norm": 0.062315549701452255,
"learning_rate": 0.0028824611226525455,
"loss": 1.7481,
"step": 21920
},
{
"epoch": 0.03910879355297464,
"grad_norm": 0.0838395208120346,
"learning_rate": 0.002882215293807556,
"loss": 1.7647,
"step": 21940
},
{
"epoch": 0.039240472992546946,
"grad_norm": 0.06503219902515411,
"learning_rate": 0.0028819692186644514,
"loss": 1.7775,
"step": 21960
},
{
"epoch": 0.03937215243211925,
"grad_norm": 0.06856662034988403,
"learning_rate": 0.0028817228972670803,
"loss": 1.7717,
"step": 21980
},
{
"epoch": 0.039503831871691555,
"grad_norm": 0.055163074284791946,
"learning_rate": 0.002881476329659335,
"loss": 1.7772,
"step": 22000
},
{
"epoch": 0.039503831871691555,
"eval_loss": 1.7622946500778198,
"eval_runtime": 67.7091,
"eval_samples_per_second": 14.769,
"eval_steps_per_second": 14.769,
"step": 22000
},
{
"epoch": 0.03963551131126386,
"grad_norm": 0.09752371162176132,
"learning_rate": 0.002881229515885151,
"loss": 1.7653,
"step": 22020
},
{
"epoch": 0.039767190750836165,
"grad_norm": 0.09371519088745117,
"learning_rate": 0.0028809824559885085,
"loss": 1.7757,
"step": 22040
},
{
"epoch": 0.03989887019040847,
"grad_norm": 0.06047109514474869,
"learning_rate": 0.002880735150013432,
"loss": 1.7666,
"step": 22060
},
{
"epoch": 0.040030549629980774,
"grad_norm": 0.07913815230131149,
"learning_rate": 0.0028804875980039885,
"loss": 1.7664,
"step": 22080
},
{
"epoch": 0.04016222906955308,
"grad_norm": 0.06452839821577072,
"learning_rate": 0.0028802398000042895,
"loss": 1.7689,
"step": 22100
},
{
"epoch": 0.040293908509125384,
"grad_norm": 0.07609876990318298,
"learning_rate": 0.0028799917560584907,
"loss": 1.767,
"step": 22120
},
{
"epoch": 0.04042558794869769,
"grad_norm": 0.07160958647727966,
"learning_rate": 0.0028797434662107906,
"loss": 1.7677,
"step": 22140
},
{
"epoch": 0.040557267388269994,
"grad_norm": 0.06023573875427246,
"learning_rate": 0.002879494930505433,
"loss": 1.766,
"step": 22160
},
{
"epoch": 0.0406889468278423,
"grad_norm": 0.06579054147005081,
"learning_rate": 0.0028792461489867043,
"loss": 1.7568,
"step": 22180
},
{
"epoch": 0.0408206262674146,
"grad_norm": 0.065089151263237,
"learning_rate": 0.0028789971216989347,
"loss": 1.7607,
"step": 22200
},
{
"epoch": 0.04095230570698691,
"grad_norm": 0.06882410496473312,
"learning_rate": 0.002878747848686499,
"loss": 1.7594,
"step": 22220
},
{
"epoch": 0.04108398514655922,
"grad_norm": 0.08353780955076218,
"learning_rate": 0.0028784983299938163,
"loss": 1.7538,
"step": 22240
},
{
"epoch": 0.041215664586131524,
"grad_norm": 0.06264527142047882,
"learning_rate": 0.002878248565665347,
"loss": 1.7511,
"step": 22260
},
{
"epoch": 0.04134734402570383,
"grad_norm": 0.06513512134552002,
"learning_rate": 0.0028779985557455968,
"loss": 1.7527,
"step": 22280
},
{
"epoch": 0.041479023465276134,
"grad_norm": 0.06116553023457527,
"learning_rate": 0.0028777483002791165,
"loss": 1.7505,
"step": 22300
},
{
"epoch": 0.04161070290484844,
"grad_norm": 0.07746737450361252,
"learning_rate": 0.002877497799310498,
"loss": 1.7506,
"step": 22320
},
{
"epoch": 0.04174238234442074,
"grad_norm": 0.05574808269739151,
"learning_rate": 0.00287724705288438,
"loss": 1.7452,
"step": 22340
},
{
"epoch": 0.04187406178399305,
"grad_norm": 0.0626768171787262,
"learning_rate": 0.002876996061045441,
"loss": 1.7506,
"step": 22360
},
{
"epoch": 0.04200574122356535,
"grad_norm": 0.07668133080005646,
"learning_rate": 0.0028767448238384073,
"loss": 1.7489,
"step": 22380
},
{
"epoch": 0.04213742066313766,
"grad_norm": 0.08054382354021072,
"learning_rate": 0.002876493341308046,
"loss": 1.7492,
"step": 22400
},
{
"epoch": 0.04226910010270996,
"grad_norm": 0.06886732578277588,
"learning_rate": 0.0028762416134991697,
"loss": 1.7482,
"step": 22420
},
{
"epoch": 0.04240077954228227,
"grad_norm": 0.11965472251176834,
"learning_rate": 0.0028759896404566333,
"loss": 1.7443,
"step": 22440
},
{
"epoch": 0.04253245898185457,
"grad_norm": 0.07691692560911179,
"learning_rate": 0.0028757374222253365,
"loss": 1.7421,
"step": 22460
},
{
"epoch": 0.04266413842142688,
"grad_norm": 0.06630564481019974,
"learning_rate": 0.002875484958850222,
"loss": 1.7439,
"step": 22480
},
{
"epoch": 0.04279581786099918,
"grad_norm": 0.06624884158372879,
"learning_rate": 0.002875232250376277,
"loss": 1.7532,
"step": 22500
},
{
"epoch": 0.042927497300571486,
"grad_norm": 0.06218545883893967,
"learning_rate": 0.002874979296848531,
"loss": 1.7689,
"step": 22520
},
{
"epoch": 0.04305917674014379,
"grad_norm": 0.08492391556501389,
"learning_rate": 0.002874726098312059,
"loss": 1.7707,
"step": 22540
},
{
"epoch": 0.043190856179716096,
"grad_norm": 0.07384103536605835,
"learning_rate": 0.0028744726548119784,
"loss": 1.7758,
"step": 22560
},
{
"epoch": 0.04332253561928841,
"grad_norm": 0.07037446647882462,
"learning_rate": 0.0028742189663934496,
"loss": 1.7694,
"step": 22580
},
{
"epoch": 0.04345421505886071,
"grad_norm": 0.06753331422805786,
"learning_rate": 0.0028739650331016785,
"loss": 1.7684,
"step": 22600
},
{
"epoch": 0.04358589449843302,
"grad_norm": 0.0832001268863678,
"learning_rate": 0.0028737108549819136,
"loss": 1.7703,
"step": 22620
},
{
"epoch": 0.04371757393800532,
"grad_norm": 0.07064741849899292,
"learning_rate": 0.002873456432079447,
"loss": 1.7782,
"step": 22640
},
{
"epoch": 0.04384925337757763,
"grad_norm": 0.06530604511499405,
"learning_rate": 0.0028732017644396137,
"loss": 1.7668,
"step": 22660
},
{
"epoch": 0.04398093281714993,
"grad_norm": 0.09668663144111633,
"learning_rate": 0.002872946852107795,
"loss": 1.7674,
"step": 22680
},
{
"epoch": 0.044112612256722236,
"grad_norm": 0.07591857761144638,
"learning_rate": 0.002872691695129412,
"loss": 1.7575,
"step": 22700
},
{
"epoch": 0.04424429169629454,
"grad_norm": 0.08346087485551834,
"learning_rate": 0.002872436293549932,
"loss": 1.7595,
"step": 22720
},
{
"epoch": 0.044375971135866846,
"grad_norm": 0.06290127336978912,
"learning_rate": 0.0028721806474148663,
"loss": 1.7576,
"step": 22740
},
{
"epoch": 0.04450765057543915,
"grad_norm": 0.06168945133686066,
"learning_rate": 0.002871924756769767,
"loss": 1.7596,
"step": 22760
},
{
"epoch": 0.044639330015011455,
"grad_norm": 0.07243330031633377,
"learning_rate": 0.002871668621660233,
"loss": 1.7604,
"step": 22780
},
{
"epoch": 0.04477100945458376,
"grad_norm": 0.06622735410928726,
"learning_rate": 0.002871412242131904,
"loss": 1.7537,
"step": 22800
},
{
"epoch": 0.044902688894156065,
"grad_norm": 0.057980917394161224,
"learning_rate": 0.0028711556182304653,
"loss": 1.7485,
"step": 22820
},
{
"epoch": 0.04503436833372837,
"grad_norm": 0.07098107784986496,
"learning_rate": 0.0028708987500016443,
"loss": 1.748,
"step": 22840
},
{
"epoch": 0.045166047773300674,
"grad_norm": 0.08247384428977966,
"learning_rate": 0.002870641637491213,
"loss": 1.7512,
"step": 22860
},
{
"epoch": 0.04529772721287298,
"grad_norm": 0.07915489375591278,
"learning_rate": 0.002870384280744987,
"loss": 1.7551,
"step": 22880
},
{
"epoch": 0.045429406652445284,
"grad_norm": 0.08467677235603333,
"learning_rate": 0.0028701266798088236,
"loss": 1.7454,
"step": 22900
},
{
"epoch": 0.045561086092017596,
"grad_norm": 0.0650927871465683,
"learning_rate": 0.002869868834728626,
"loss": 1.7409,
"step": 22920
},
{
"epoch": 0.0456927655315899,
"grad_norm": 0.08258968591690063,
"learning_rate": 0.002869610745550339,
"loss": 1.747,
"step": 22940
},
{
"epoch": 0.045824444971162205,
"grad_norm": 0.06526441127061844,
"learning_rate": 0.0028693524123199524,
"loss": 1.7494,
"step": 22960
},
{
"epoch": 0.04595612441073451,
"grad_norm": 0.08214429020881653,
"learning_rate": 0.0028690938350834994,
"loss": 1.7537,
"step": 22980
},
{
"epoch": 0.046087803850306815,
"grad_norm": 0.06021787226200104,
"learning_rate": 0.0028688350138870544,
"loss": 1.7492,
"step": 23000
},
{
"epoch": 0.046087803850306815,
"eval_loss": 1.614139437675476,
"eval_runtime": 64.9061,
"eval_samples_per_second": 15.407,
"eval_steps_per_second": 15.407,
"step": 23000
},
{
"epoch": 0.04621948328987912,
"grad_norm": 0.09553001075983047,
"learning_rate": 0.002868575948776738,
"loss": 1.751,
"step": 23020
},
{
"epoch": 0.046351162729451424,
"grad_norm": 0.06959230452775955,
"learning_rate": 0.0028683166397987137,
"loss": 1.7443,
"step": 23040
},
{
"epoch": 0.04648284216902373,
"grad_norm": 0.07799062877893448,
"learning_rate": 0.0028680570869991863,
"loss": 1.7412,
"step": 23060
},
{
"epoch": 0.046614521608596034,
"grad_norm": 0.06044070050120354,
"learning_rate": 0.002867797290424408,
"loss": 1.7404,
"step": 23080
},
{
"epoch": 0.04674620104816834,
"grad_norm": 0.06427774578332901,
"learning_rate": 0.00286753725012067,
"loss": 1.7424,
"step": 23100
},
{
"epoch": 0.04687788048774064,
"grad_norm": 0.0699395090341568,
"learning_rate": 0.002867276966134311,
"loss": 1.7364,
"step": 23120
},
{
"epoch": 0.04700955992731295,
"grad_norm": 0.05850491672754288,
"learning_rate": 0.00286701643851171,
"loss": 1.6901,
"step": 23140
},
{
"epoch": 0.04714123936688525,
"grad_norm": 0.07173515111207962,
"learning_rate": 0.002866755667299291,
"loss": 1.6853,
"step": 23160
},
{
"epoch": 0.04727291880645756,
"grad_norm": 0.10769501328468323,
"learning_rate": 0.002866494652543521,
"loss": 1.6832,
"step": 23180
},
{
"epoch": 0.04740459824602986,
"grad_norm": 0.08263743668794632,
"learning_rate": 0.0028662333942909104,
"loss": 1.6789,
"step": 23200
},
{
"epoch": 0.04753627768560217,
"grad_norm": 0.06656038016080856,
"learning_rate": 0.0028659718925880128,
"loss": 1.6759,
"step": 23220
},
{
"epoch": 0.04766795712517447,
"grad_norm": 0.0891193225979805,
"learning_rate": 0.0028657101474814264,
"loss": 1.6761,
"step": 23240
},
{
"epoch": 0.047799636564746784,
"grad_norm": 0.08038073033094406,
"learning_rate": 0.0028654481590177907,
"loss": 1.6701,
"step": 23260
},
{
"epoch": 0.04793131600431909,
"grad_norm": 0.08320681005716324,
"learning_rate": 0.0028651859272437897,
"loss": 1.6733,
"step": 23280
},
{
"epoch": 0.04806299544389139,
"grad_norm": 0.0696556568145752,
"learning_rate": 0.0028649234522061516,
"loss": 1.6736,
"step": 23300
},
{
"epoch": 0.0481946748834637,
"grad_norm": 0.08962351828813553,
"learning_rate": 0.002864660733951646,
"loss": 1.6655,
"step": 23320
},
{
"epoch": 0.048326354323036,
"grad_norm": 0.07071159034967422,
"learning_rate": 0.0028643977725270877,
"loss": 1.6765,
"step": 23340
},
{
"epoch": 0.04845803376260831,
"grad_norm": 0.07777654379606247,
"learning_rate": 0.0028641345679793337,
"loss": 1.6659,
"step": 23360
},
{
"epoch": 0.04858971320218061,
"grad_norm": 0.0689220279455185,
"learning_rate": 0.002863871120355285,
"loss": 1.6657,
"step": 23380
},
{
"epoch": 0.04872139264175292,
"grad_norm": 0.08802857995033264,
"learning_rate": 0.002863607429701884,
"loss": 1.67,
"step": 23400
},
{
"epoch": 0.04885307208132522,
"grad_norm": 0.06455916166305542,
"learning_rate": 0.00286334349606612,
"loss": 1.6648,
"step": 23420
},
{
"epoch": 0.048984751520897526,
"grad_norm": 0.06590025126934052,
"learning_rate": 0.0028630793194950226,
"loss": 1.6652,
"step": 23440
},
{
"epoch": 0.04911643096046983,
"grad_norm": 0.07274986058473587,
"learning_rate": 0.0028628149000356658,
"loss": 1.6589,
"step": 23460
},
{
"epoch": 0.049248110400042136,
"grad_norm": 0.079200379550457,
"learning_rate": 0.0028625502377351664,
"loss": 1.6592,
"step": 23480
},
{
"epoch": 0.04937978983961444,
"grad_norm": 0.08473269641399384,
"learning_rate": 0.0028622853326406854,
"loss": 1.6639,
"step": 23500
},
{
"epoch": 0.049511469279186746,
"grad_norm": 0.0783248320221901,
"learning_rate": 0.002862020184799426,
"loss": 1.6609,
"step": 23520
},
{
"epoch": 0.04964314871875905,
"grad_norm": 0.08220840990543365,
"learning_rate": 0.002861754794258635,
"loss": 1.6648,
"step": 23540
},
{
"epoch": 0.049774828158331355,
"grad_norm": 0.06549611687660217,
"learning_rate": 0.002861489161065603,
"loss": 1.6619,
"step": 23560
},
{
"epoch": 0.04990650759790366,
"grad_norm": 0.07199726998806,
"learning_rate": 0.0028612232852676636,
"loss": 1.6671,
"step": 23580
},
{
"epoch": 0.05003818703747597,
"grad_norm": 0.08660496026277542,
"learning_rate": 0.0028609571669121927,
"loss": 1.6667,
"step": 23600
},
{
"epoch": 0.050169866477048276,
"grad_norm": 0.10165523737668991,
"learning_rate": 0.002860690806046611,
"loss": 1.6579,
"step": 23620
},
{
"epoch": 0.05030154591662058,
"grad_norm": 0.07491469383239746,
"learning_rate": 0.00286042420271838,
"loss": 1.662,
"step": 23640
},
{
"epoch": 0.050433225356192886,
"grad_norm": 0.08252348750829697,
"learning_rate": 0.0028601573569750085,
"loss": 1.6665,
"step": 23660
},
{
"epoch": 0.05056490479576519,
"grad_norm": 0.06357965618371964,
"learning_rate": 0.0028598902688640434,
"loss": 1.6753,
"step": 23680
},
{
"epoch": 0.050696584235337495,
"grad_norm": 0.06429125368595123,
"learning_rate": 0.0028596229384330787,
"loss": 1.6727,
"step": 23700
},
{
"epoch": 0.0508282636749098,
"grad_norm": 0.0685480460524559,
"learning_rate": 0.0028593553657297504,
"loss": 1.6862,
"step": 23720
},
{
"epoch": 0.050959943114482105,
"grad_norm": 0.06911630928516388,
"learning_rate": 0.002859087550801737,
"loss": 1.6896,
"step": 23740
},
{
"epoch": 0.05109162255405441,
"grad_norm": 0.06673968583345413,
"learning_rate": 0.0028588194936967604,
"loss": 1.6872,
"step": 23760
},
{
"epoch": 0.051223301993626714,
"grad_norm": 0.08397223055362701,
"learning_rate": 0.0028585511944625866,
"loss": 1.6822,
"step": 23780
},
{
"epoch": 0.05135498143319902,
"grad_norm": 0.0685010775923729,
"learning_rate": 0.002858282653147024,
"loss": 1.6926,
"step": 23800
},
{
"epoch": 0.051486660872771324,
"grad_norm": 0.06479799002408981,
"learning_rate": 0.0028580138697979237,
"loss": 1.6875,
"step": 23820
},
{
"epoch": 0.05161834031234363,
"grad_norm": 0.06732255220413208,
"learning_rate": 0.002857744844463181,
"loss": 1.6848,
"step": 23840
},
{
"epoch": 0.051750019751915934,
"grad_norm": 0.06983063369989395,
"learning_rate": 0.0028574755771907335,
"loss": 1.6812,
"step": 23860
},
{
"epoch": 0.05188169919148824,
"grad_norm": 0.07041189819574356,
"learning_rate": 0.0028572060680285617,
"loss": 1.6756,
"step": 23880
},
{
"epoch": 0.05201337863106054,
"grad_norm": 0.06055330112576485,
"learning_rate": 0.0028569363170246904,
"loss": 1.6781,
"step": 23900
},
{
"epoch": 0.052145058070632855,
"grad_norm": 0.07243553549051285,
"learning_rate": 0.0028566663242271862,
"loss": 1.6781,
"step": 23920
},
{
"epoch": 0.05227673751020516,
"grad_norm": 0.08006641268730164,
"learning_rate": 0.00285639608968416,
"loss": 1.6846,
"step": 23940
},
{
"epoch": 0.052408416949777464,
"grad_norm": 0.10588499903678894,
"learning_rate": 0.0028561256134437647,
"loss": 1.6757,
"step": 23960
},
{
"epoch": 0.05254009638934977,
"grad_norm": 0.07262659072875977,
"learning_rate": 0.0028558548955541965,
"loss": 1.6781,
"step": 23980
},
{
"epoch": 0.052671775828922074,
"grad_norm": 0.06767702847719193,
"learning_rate": 0.002855583936063695,
"loss": 1.672,
"step": 24000
},
{
"epoch": 0.052671775828922074,
"eval_loss": 1.5004775524139404,
"eval_runtime": 67.8841,
"eval_samples_per_second": 14.731,
"eval_steps_per_second": 14.731,
"step": 24000
},
{
"epoch": 0.05280345526849438,
"grad_norm": 0.08169445395469666,
"learning_rate": 0.002855312735020543,
"loss": 1.675,
"step": 24020
},
{
"epoch": 0.05293513470806668,
"grad_norm": 0.06959936767816544,
"learning_rate": 0.0028550412924730657,
"loss": 1.6778,
"step": 24040
},
{
"epoch": 0.05306681414763899,
"grad_norm": 0.08186500519514084,
"learning_rate": 0.002854769608469632,
"loss": 1.6797,
"step": 24060
},
{
"epoch": 0.05319849358721129,
"grad_norm": 0.07614962756633759,
"learning_rate": 0.002854497683058653,
"loss": 1.6682,
"step": 24080
},
{
"epoch": 0.0533301730267836,
"grad_norm": 0.06458086520433426,
"learning_rate": 0.002854225516288584,
"loss": 1.6777,
"step": 24100
},
{
"epoch": 0.0534618524663559,
"grad_norm": 0.07567057013511658,
"learning_rate": 0.002853953108207922,
"loss": 1.6709,
"step": 24120
},
{
"epoch": 0.05359353190592821,
"grad_norm": 0.06437589973211288,
"learning_rate": 0.002853680458865208,
"loss": 1.672,
"step": 24140
},
{
"epoch": 0.05372521134550051,
"grad_norm": 0.09382762014865875,
"learning_rate": 0.0028534075683090254,
"loss": 1.6754,
"step": 24160
},
{
"epoch": 0.05385689078507282,
"grad_norm": 0.06308145076036453,
"learning_rate": 0.002853134436588001,
"loss": 1.6796,
"step": 24180
},
{
"epoch": 0.05398857022464512,
"grad_norm": 0.07414955645799637,
"learning_rate": 0.002852861063750804,
"loss": 1.6753,
"step": 24200
},
{
"epoch": 0.054120249664217426,
"grad_norm": 0.08207368105649948,
"learning_rate": 0.0028525874498461475,
"loss": 1.6737,
"step": 24220
},
{
"epoch": 0.05425192910378973,
"grad_norm": 0.1388959437608719,
"learning_rate": 0.0028523135949227864,
"loss": 1.6711,
"step": 24240
},
{
"epoch": 0.05438360854336204,
"grad_norm": 0.07871943712234497,
"learning_rate": 0.0028520394990295193,
"loss": 1.6799,
"step": 24260
},
{
"epoch": 0.05451528798293435,
"grad_norm": 0.0691281110048294,
"learning_rate": 0.0028517651622151884,
"loss": 1.6845,
"step": 24280
},
{
"epoch": 0.05464696742250665,
"grad_norm": 0.07609487324953079,
"learning_rate": 0.002851490584528677,
"loss": 1.7203,
"step": 24300
},
{
"epoch": 0.05477864686207896,
"grad_norm": 0.07939011603593826,
"learning_rate": 0.002851215766018913,
"loss": 1.7355,
"step": 24320
},
{
"epoch": 0.05491032630165126,
"grad_norm": 0.0882917046546936,
"learning_rate": 0.0028509407067348652,
"loss": 1.7458,
"step": 24340
},
{
"epoch": 0.05504200574122357,
"grad_norm": 0.08259212225675583,
"learning_rate": 0.0028506654067255487,
"loss": 1.7469,
"step": 24360
},
{
"epoch": 0.05517368518079587,
"grad_norm": 0.0653611272573471,
"learning_rate": 0.0028503898660400175,
"loss": 1.7565,
"step": 24380
},
{
"epoch": 0.055305364620368176,
"grad_norm": 0.07420220971107483,
"learning_rate": 0.002850114084727372,
"loss": 1.7467,
"step": 24400
},
{
"epoch": 0.05543704405994048,
"grad_norm": 0.12061482667922974,
"learning_rate": 0.002849838062836753,
"loss": 1.7476,
"step": 24420
},
{
"epoch": 0.055568723499512786,
"grad_norm": 0.08582179993391037,
"learning_rate": 0.0028495618004173453,
"loss": 1.743,
"step": 24440
},
{
"epoch": 0.05570040293908509,
"grad_norm": 0.11333516985177994,
"learning_rate": 0.0028492852975183767,
"loss": 1.7446,
"step": 24460
},
{
"epoch": 0.055832082378657395,
"grad_norm": 0.06701093912124634,
"learning_rate": 0.0028490085541891166,
"loss": 1.7329,
"step": 24480
},
{
"epoch": 0.0559637618182297,
"grad_norm": 0.07070864737033844,
"learning_rate": 0.0028487315704788787,
"loss": 1.741,
"step": 24500
},
{
"epoch": 0.056095441257802005,
"grad_norm": 0.08799562603235245,
"learning_rate": 0.0028484543464370187,
"loss": 1.7349,
"step": 24520
},
{
"epoch": 0.05622712069737431,
"grad_norm": 0.08984426409006119,
"learning_rate": 0.002848176882112936,
"loss": 1.7277,
"step": 24540
},
{
"epoch": 0.056358800136946614,
"grad_norm": 0.08583886176347733,
"learning_rate": 0.002847899177556072,
"loss": 1.7304,
"step": 24560
},
{
"epoch": 0.05649047957651892,
"grad_norm": 0.07309599220752716,
"learning_rate": 0.0028476212328159105,
"loss": 1.736,
"step": 24580
},
{
"epoch": 0.05662215901609123,
"grad_norm": 0.10758428275585175,
"learning_rate": 0.0028473430479419794,
"loss": 1.7309,
"step": 24600
},
{
"epoch": 0.056753838455663536,
"grad_norm": 0.07512976229190826,
"learning_rate": 0.0028470646229838475,
"loss": 1.7258,
"step": 24620
},
{
"epoch": 0.05688551789523584,
"grad_norm": 0.09403645247220993,
"learning_rate": 0.00284678595799113,
"loss": 1.7245,
"step": 24640
},
{
"epoch": 0.057017197334808145,
"grad_norm": 0.06885070353746414,
"learning_rate": 0.0028465070530134797,
"loss": 1.7257,
"step": 24660
},
{
"epoch": 0.05714887677438045,
"grad_norm": 0.07384008169174194,
"learning_rate": 0.0028462279081005967,
"loss": 1.7237,
"step": 24680
},
{
"epoch": 0.057280556213952755,
"grad_norm": 0.08138833940029144,
"learning_rate": 0.0028459485233022215,
"loss": 1.7216,
"step": 24700
},
{
"epoch": 0.05741223565352506,
"grad_norm": 0.057137709110975266,
"learning_rate": 0.002845668898668138,
"loss": 1.7229,
"step": 24720
},
{
"epoch": 0.057543915093097364,
"grad_norm": 0.06821935623884201,
"learning_rate": 0.0028453890342481727,
"loss": 1.7139,
"step": 24740
},
{
"epoch": 0.05767559453266967,
"grad_norm": 0.07039092481136322,
"learning_rate": 0.002845108930092195,
"loss": 1.7257,
"step": 24760
},
{
"epoch": 0.057807273972241974,
"grad_norm": 0.06676448881626129,
"learning_rate": 0.0028448285862501164,
"loss": 1.7204,
"step": 24780
},
{
"epoch": 0.05793895341181428,
"grad_norm": 0.0648011863231659,
"learning_rate": 0.0028445480027718922,
"loss": 1.7128,
"step": 24800
},
{
"epoch": 0.05807063285138658,
"grad_norm": 0.07681864500045776,
"learning_rate": 0.0028442671797075194,
"loss": 1.7201,
"step": 24820
},
{
"epoch": 0.05820231229095889,
"grad_norm": 0.06368867307901382,
"learning_rate": 0.0028439861171070386,
"loss": 1.7169,
"step": 24840
},
{
"epoch": 0.05833399173053119,
"grad_norm": 0.08015841245651245,
"learning_rate": 0.0028437048150205322,
"loss": 1.7143,
"step": 24860
},
{
"epoch": 0.0584656711701035,
"grad_norm": 0.06920666247606277,
"learning_rate": 0.0028434232734981255,
"loss": 1.7262,
"step": 24880
},
{
"epoch": 0.0585973506096758,
"grad_norm": 0.1089114099740982,
"learning_rate": 0.002843141492589987,
"loss": 1.7356,
"step": 24900
},
{
"epoch": 0.05872903004924811,
"grad_norm": 0.06988651305437088,
"learning_rate": 0.0028428594723463275,
"loss": 1.7347,
"step": 24920
},
{
"epoch": 0.05886070948882042,
"grad_norm": 0.076754629611969,
"learning_rate": 0.0028425772128173998,
"loss": 1.7332,
"step": 24940
},
{
"epoch": 0.058992388928392724,
"grad_norm": 0.07548579573631287,
"learning_rate": 0.0028422947140535008,
"loss": 1.7258,
"step": 24960
},
{
"epoch": 0.05912406836796503,
"grad_norm": 0.0791606530547142,
"learning_rate": 0.0028420119761049687,
"loss": 1.7298,
"step": 24980
},
{
"epoch": 0.05925574780753733,
"grad_norm": 0.06826753914356232,
"learning_rate": 0.0028417289990221853,
"loss": 1.7286,
"step": 25000
},
{
"epoch": 0.05925574780753733,
"eval_loss": 1.641815423965454,
"eval_runtime": 66.1639,
"eval_samples_per_second": 15.114,
"eval_steps_per_second": 15.114,
"step": 25000
},
{
"epoch": 0.05938742724710964,
"grad_norm": 0.06096088886260986,
"learning_rate": 0.0028414457828555735,
"loss": 1.7278,
"step": 25020
},
{
"epoch": 0.05951910668668194,
"grad_norm": 0.0753740519285202,
"learning_rate": 0.0028411623276556005,
"loss": 1.7184,
"step": 25040
},
{
"epoch": 0.05965078612625425,
"grad_norm": 0.06860582530498505,
"learning_rate": 0.0028408786334727758,
"loss": 1.7238,
"step": 25060
},
{
"epoch": 0.05978246556582655,
"grad_norm": 0.08930736780166626,
"learning_rate": 0.0028405947003576505,
"loss": 1.717,
"step": 25080
},
{
"epoch": 0.05991414500539886,
"grad_norm": 0.06507642567157745,
"learning_rate": 0.002840310528360819,
"loss": 1.7187,
"step": 25100
},
{
"epoch": 0.06004582444497116,
"grad_norm": 0.07465964555740356,
"learning_rate": 0.0028400261175329186,
"loss": 1.7214,
"step": 25120
},
{
"epoch": 0.060177503884543466,
"grad_norm": 0.08822104334831238,
"learning_rate": 0.002839741467924628,
"loss": 1.7129,
"step": 25140
},
{
"epoch": 0.06030918332411577,
"grad_norm": 0.12070819735527039,
"learning_rate": 0.00283945657958667,
"loss": 1.7093,
"step": 25160
},
{
"epoch": 0.060440862763688076,
"grad_norm": 0.06325086951255798,
"learning_rate": 0.002839171452569808,
"loss": 1.7043,
"step": 25180
},
{
"epoch": 0.06057254220326038,
"grad_norm": 0.07239518314599991,
"learning_rate": 0.00283888608692485,
"loss": 1.7006,
"step": 25200
},
{
"epoch": 0.060704221642832686,
"grad_norm": 0.08891430497169495,
"learning_rate": 0.002838600482702645,
"loss": 1.7102,
"step": 25220
},
{
"epoch": 0.06083590108240499,
"grad_norm": 0.06925225257873535,
"learning_rate": 0.0028383146399540856,
"loss": 1.7128,
"step": 25240
},
{
"epoch": 0.060967580521977295,
"grad_norm": 0.10547026246786118,
"learning_rate": 0.0028380285587301054,
"loss": 1.7051,
"step": 25260
},
{
"epoch": 0.06109925996154961,
"grad_norm": 0.07027033716440201,
"learning_rate": 0.0028377422390816823,
"loss": 1.7204,
"step": 25280
},
{
"epoch": 0.06123093940112191,
"grad_norm": 0.06962334364652634,
"learning_rate": 0.0028374556810598357,
"loss": 1.714,
"step": 25300
},
{
"epoch": 0.061362618840694216,
"grad_norm": 0.09216281771659851,
"learning_rate": 0.0028371688847156277,
"loss": 1.7058,
"step": 25320
},
{
"epoch": 0.06149429828026652,
"grad_norm": 0.07846725732088089,
"learning_rate": 0.0028368818501001624,
"loss": 1.712,
"step": 25340
},
{
"epoch": 0.061625977719838826,
"grad_norm": 0.11076796799898148,
"learning_rate": 0.002836594577264587,
"loss": 1.7075,
"step": 25360
},
{
"epoch": 0.06175765715941113,
"grad_norm": 0.07543148845434189,
"learning_rate": 0.00283630706626009,
"loss": 1.7033,
"step": 25380
},
{
"epoch": 0.061889336598983435,
"grad_norm": 0.08785652369260788,
"learning_rate": 0.002836019317137905,
"loss": 1.7076,
"step": 25400
},
{
"epoch": 0.06202101603855574,
"grad_norm": 0.0767190009355545,
"learning_rate": 0.002835731329949305,
"loss": 1.6997,
"step": 25420
},
{
"epoch": 0.062152695478128045,
"grad_norm": 0.06853576004505157,
"learning_rate": 0.002835443104745607,
"loss": 1.7111,
"step": 25440
},
{
"epoch": 0.06228437491770035,
"grad_norm": 0.07039535045623779,
"learning_rate": 0.0028351546415781703,
"loss": 1.6986,
"step": 25460
},
{
"epoch": 0.062416054357272654,
"grad_norm": 0.06429757922887802,
"learning_rate": 0.002834865940498396,
"loss": 1.7016,
"step": 25480
},
{
"epoch": 0.06254773379684496,
"grad_norm": 0.06879903376102448,
"learning_rate": 0.0028345770015577275,
"loss": 1.6425,
"step": 25500
},
{
"epoch": 0.06267941323641726,
"grad_norm": 0.0694214403629303,
"learning_rate": 0.0028342878248076527,
"loss": 1.5967,
"step": 25520
},
{
"epoch": 0.06281109267598957,
"grad_norm": 0.07605341076850891,
"learning_rate": 0.002833998410299699,
"loss": 1.5833,
"step": 25540
},
{
"epoch": 0.06294277211556187,
"grad_norm": 0.06291548907756805,
"learning_rate": 0.002833708758085438,
"loss": 1.5772,
"step": 25560
},
{
"epoch": 0.06307445155513418,
"grad_norm": 0.06334402412176132,
"learning_rate": 0.0028334188682164825,
"loss": 1.5762,
"step": 25580
},
{
"epoch": 0.06320613099470648,
"grad_norm": 0.0940147116780281,
"learning_rate": 0.002833128740744488,
"loss": 1.5723,
"step": 25600
},
{
"epoch": 0.06333781043427879,
"grad_norm": 0.0760306864976883,
"learning_rate": 0.002832838375721154,
"loss": 1.5759,
"step": 25620
},
{
"epoch": 0.06346948987385109,
"grad_norm": 0.08564443141222,
"learning_rate": 0.0028325477731982194,
"loss": 1.5828,
"step": 25640
},
{
"epoch": 0.0636011693134234,
"grad_norm": 0.07691756635904312,
"learning_rate": 0.0028322569332274675,
"loss": 1.5797,
"step": 25660
},
{
"epoch": 0.0637328487529957,
"grad_norm": 0.07960242033004761,
"learning_rate": 0.002831965855860723,
"loss": 1.575,
"step": 25680
},
{
"epoch": 0.06386452819256801,
"grad_norm": 0.08058685809373856,
"learning_rate": 0.0028316745411498543,
"loss": 1.5784,
"step": 25700
},
{
"epoch": 0.06399620763214031,
"grad_norm": 0.07303532212972641,
"learning_rate": 0.00283138298914677,
"loss": 1.5821,
"step": 25720
},
{
"epoch": 0.06412788707171262,
"grad_norm": 0.09177567064762115,
"learning_rate": 0.002831091199903422,
"loss": 1.5731,
"step": 25740
},
{
"epoch": 0.06425956651128492,
"grad_norm": 0.07598966360092163,
"learning_rate": 0.0028307991734718044,
"loss": 1.5735,
"step": 25760
},
{
"epoch": 0.06439124595085724,
"grad_norm": 0.07235264033079147,
"learning_rate": 0.0028305069099039543,
"loss": 1.5749,
"step": 25780
},
{
"epoch": 0.06452292539042954,
"grad_norm": 0.08868271857500076,
"learning_rate": 0.00283021440925195,
"loss": 1.5741,
"step": 25800
},
{
"epoch": 0.06465460483000185,
"grad_norm": 0.08162138611078262,
"learning_rate": 0.0028299216715679124,
"loss": 1.578,
"step": 25820
},
{
"epoch": 0.06478628426957415,
"grad_norm": 0.0805659294128418,
"learning_rate": 0.002829628696904005,
"loss": 1.5809,
"step": 25840
},
{
"epoch": 0.06491796370914646,
"grad_norm": 0.07114304602146149,
"learning_rate": 0.0028293354853124327,
"loss": 1.5869,
"step": 25860
},
{
"epoch": 0.06504964314871876,
"grad_norm": 0.06668581813573837,
"learning_rate": 0.0028290420368454433,
"loss": 1.5876,
"step": 25880
},
{
"epoch": 0.06518132258829107,
"grad_norm": 0.07414104044437408,
"learning_rate": 0.0028287483515553272,
"loss": 1.5846,
"step": 25900
},
{
"epoch": 0.06531300202786337,
"grad_norm": 0.07118961215019226,
"learning_rate": 0.002828454429494415,
"loss": 1.5878,
"step": 25920
},
{
"epoch": 0.06544468146743568,
"grad_norm": 0.08453836292028427,
"learning_rate": 0.0028281602707150824,
"loss": 1.5897,
"step": 25940
},
{
"epoch": 0.06557636090700798,
"grad_norm": 0.07505936175584793,
"learning_rate": 0.0028278658752697453,
"loss": 1.5864,
"step": 25960
},
{
"epoch": 0.06570804034658029,
"grad_norm": 0.07345987111330032,
"learning_rate": 0.0028275712432108626,
"loss": 1.5844,
"step": 25980
},
{
"epoch": 0.06583971978615259,
"grad_norm": 0.09382303059101105,
"learning_rate": 0.002827276374590934,
"loss": 1.5951,
"step": 26000
},
{
"epoch": 0.06583971978615259,
"eval_loss": 1.7229478359222412,
"eval_runtime": 67.2917,
"eval_samples_per_second": 14.861,
"eval_steps_per_second": 14.861,
"step": 26000
},
{
"epoch": 0.0659713992257249,
"grad_norm": 0.07171901315450668,
"learning_rate": 0.0028269812694625036,
"loss": 1.5965,
"step": 26020
},
{
"epoch": 0.0661030786652972,
"grad_norm": 0.11737576127052307,
"learning_rate": 0.002826685927878155,
"loss": 1.5861,
"step": 26040
},
{
"epoch": 0.0662347581048695,
"grad_norm": 0.1007668673992157,
"learning_rate": 0.002826390349890517,
"loss": 1.6206,
"step": 26060
},
{
"epoch": 0.06636643754444181,
"grad_norm": 0.07489984482526779,
"learning_rate": 0.0028260945355522583,
"loss": 1.6584,
"step": 26080
},
{
"epoch": 0.06649811698401412,
"grad_norm": 0.07443971931934357,
"learning_rate": 0.0028257984849160895,
"loss": 1.6751,
"step": 26100
},
{
"epoch": 0.06662979642358642,
"grad_norm": 0.07076618820428848,
"learning_rate": 0.0028255021980347654,
"loss": 1.6871,
"step": 26120
},
{
"epoch": 0.06676147586315873,
"grad_norm": 0.08177798986434937,
"learning_rate": 0.0028252056749610804,
"loss": 1.6991,
"step": 26140
},
{
"epoch": 0.06689315530273103,
"grad_norm": 0.08380310237407684,
"learning_rate": 0.0028249089157478735,
"loss": 1.6959,
"step": 26160
},
{
"epoch": 0.06702483474230334,
"grad_norm": 0.08319336175918579,
"learning_rate": 0.0028246119204480232,
"loss": 1.6876,
"step": 26180
},
{
"epoch": 0.06715651418187564,
"grad_norm": 0.07932873070240021,
"learning_rate": 0.0028243146891144518,
"loss": 1.6902,
"step": 26200
},
{
"epoch": 0.06728819362144794,
"grad_norm": 0.06260685622692108,
"learning_rate": 0.0028240172218001233,
"loss": 1.6899,
"step": 26220
},
{
"epoch": 0.06741987306102025,
"grad_norm": 0.09259559959173203,
"learning_rate": 0.002823719518558044,
"loss": 1.6746,
"step": 26240
},
{
"epoch": 0.06755155250059255,
"grad_norm": 0.08179523050785065,
"learning_rate": 0.0028234215794412615,
"loss": 1.6782,
"step": 26260
},
{
"epoch": 0.06768323194016486,
"grad_norm": 0.08897533267736435,
"learning_rate": 0.002823123404502866,
"loss": 1.6725,
"step": 26280
},
{
"epoch": 0.06781491137973716,
"grad_norm": 0.06979696452617645,
"learning_rate": 0.0028228249937959893,
"loss": 1.6782,
"step": 26300
},
{
"epoch": 0.06794659081930947,
"grad_norm": 0.08062341064214706,
"learning_rate": 0.002822526347373805,
"loss": 1.6731,
"step": 26320
},
{
"epoch": 0.06807827025888177,
"grad_norm": 0.08686768263578415,
"learning_rate": 0.0028222274652895305,
"loss": 1.6711,
"step": 26340
},
{
"epoch": 0.06820994969845408,
"grad_norm": 0.07862361520528793,
"learning_rate": 0.0028219283475964226,
"loss": 1.6678,
"step": 26360
},
{
"epoch": 0.06834162913802638,
"grad_norm": 0.08037963509559631,
"learning_rate": 0.0028216289943477817,
"loss": 1.6723,
"step": 26380
},
{
"epoch": 0.06847330857759869,
"grad_norm": 0.06775148212909698,
"learning_rate": 0.0028213294055969506,
"loss": 1.6675,
"step": 26400
},
{
"epoch": 0.06860498801717099,
"grad_norm": 0.07389701157808304,
"learning_rate": 0.0028210295813973123,
"loss": 1.6645,
"step": 26420
},
{
"epoch": 0.0687366674567433,
"grad_norm": 0.0821567252278328,
"learning_rate": 0.0028207295218022925,
"loss": 1.664,
"step": 26440
},
{
"epoch": 0.06886834689631562,
"grad_norm": 0.0829467922449112,
"learning_rate": 0.0028204292268653604,
"loss": 1.66,
"step": 26460
},
{
"epoch": 0.06900002633588792,
"grad_norm": 0.07580474019050598,
"learning_rate": 0.0028201286966400246,
"loss": 1.6631,
"step": 26480
},
{
"epoch": 0.06913170577546023,
"grad_norm": 0.07539396733045578,
"learning_rate": 0.0028198279311798372,
"loss": 1.6594,
"step": 26500
},
{
"epoch": 0.06926338521503253,
"grad_norm": 0.08187814056873322,
"learning_rate": 0.0028195269305383917,
"loss": 1.6656,
"step": 26520
},
{
"epoch": 0.06939506465460483,
"grad_norm": 0.08854663372039795,
"learning_rate": 0.0028192256947693244,
"loss": 1.6616,
"step": 26540
},
{
"epoch": 0.06952674409417714,
"grad_norm": 0.08540527522563934,
"learning_rate": 0.0028189242239263124,
"loss": 1.6572,
"step": 26560
},
{
"epoch": 0.06965842353374944,
"grad_norm": 0.07513197511434555,
"learning_rate": 0.0028186225180630744,
"loss": 1.658,
"step": 26580
},
{
"epoch": 0.06979010297332175,
"grad_norm": 0.09598047286272049,
"learning_rate": 0.002818320577233372,
"loss": 1.667,
"step": 26600
},
{
"epoch": 0.06992178241289405,
"grad_norm": 0.07224708050489426,
"learning_rate": 0.0028180184014910082,
"loss": 1.6529,
"step": 26620
},
{
"epoch": 0.07005346185246636,
"grad_norm": 0.08062656968832016,
"learning_rate": 0.0028177159908898282,
"loss": 1.6542,
"step": 26640
},
{
"epoch": 0.07018514129203866,
"grad_norm": 0.07291059195995331,
"learning_rate": 0.0028174133454837193,
"loss": 1.6783,
"step": 26660
},
{
"epoch": 0.07031682073161097,
"grad_norm": 0.07700487226247787,
"learning_rate": 0.002817110465326609,
"loss": 1.7044,
"step": 26680
},
{
"epoch": 0.07044850017118327,
"grad_norm": 0.23015104234218597,
"learning_rate": 0.002816807350472469,
"loss": 1.7165,
"step": 26700
},
{
"epoch": 0.07058017961075558,
"grad_norm": 0.10937873274087906,
"learning_rate": 0.00281650400097531,
"loss": 1.7157,
"step": 26720
},
{
"epoch": 0.07071185905032788,
"grad_norm": 0.0746932178735733,
"learning_rate": 0.0028162004168891877,
"loss": 1.7176,
"step": 26740
},
{
"epoch": 0.07084353848990019,
"grad_norm": 0.07187461853027344,
"learning_rate": 0.0028158965982681976,
"loss": 1.7088,
"step": 26760
},
{
"epoch": 0.07097521792947249,
"grad_norm": 0.0845644474029541,
"learning_rate": 0.0028155925451664766,
"loss": 1.7109,
"step": 26780
},
{
"epoch": 0.0711068973690448,
"grad_norm": 0.0642613023519516,
"learning_rate": 0.002815288257638205,
"loss": 1.7109,
"step": 26800
},
{
"epoch": 0.0712385768086171,
"grad_norm": 0.06674417108297348,
"learning_rate": 0.0028149837357376033,
"loss": 1.7072,
"step": 26820
},
{
"epoch": 0.0713702562481894,
"grad_norm": 0.0797337219119072,
"learning_rate": 0.0028146789795189353,
"loss": 1.7036,
"step": 26840
},
{
"epoch": 0.07150193568776171,
"grad_norm": 0.06999875605106354,
"learning_rate": 0.0028143739890365053,
"loss": 1.6998,
"step": 26860
},
{
"epoch": 0.07163361512733402,
"grad_norm": 0.10101525485515594,
"learning_rate": 0.0028140687643446603,
"loss": 1.6987,
"step": 26880
},
{
"epoch": 0.07176529456690632,
"grad_norm": 0.06726180762052536,
"learning_rate": 0.002813763305497788,
"loss": 1.7011,
"step": 26900
},
{
"epoch": 0.07189697400647863,
"grad_norm": 0.07989557832479477,
"learning_rate": 0.002813457612550319,
"loss": 1.6982,
"step": 26920
},
{
"epoch": 0.07202865344605093,
"grad_norm": 0.08156982809305191,
"learning_rate": 0.0028131516855567236,
"loss": 1.6946,
"step": 26940
},
{
"epoch": 0.07216033288562324,
"grad_norm": 0.09064619243144989,
"learning_rate": 0.0028128455245715173,
"loss": 1.6942,
"step": 26960
},
{
"epoch": 0.07229201232519554,
"grad_norm": 0.08123116940259933,
"learning_rate": 0.0028125391296492533,
"loss": 1.6931,
"step": 26980
},
{
"epoch": 0.07242369176476784,
"grad_norm": 0.07538691908121109,
"learning_rate": 0.00281223250084453,
"loss": 1.6849,
"step": 27000
},
{
"epoch": 0.07242369176476784,
"eval_loss": 1.7134445905685425,
"eval_runtime": 66.2906,
"eval_samples_per_second": 15.085,
"eval_steps_per_second": 15.085,
"step": 27000
},
{
"epoch": 0.07255537120434015,
"grad_norm": 0.07675933837890625,
"learning_rate": 0.0028119256382119844,
"loss": 1.6956,
"step": 27020
},
{
"epoch": 0.07268705064391245,
"grad_norm": 0.07131894677877426,
"learning_rate": 0.0028116185418062965,
"loss": 1.6849,
"step": 27040
},
{
"epoch": 0.07281873008348476,
"grad_norm": 0.07346808910369873,
"learning_rate": 0.0028113112116821895,
"loss": 1.6826,
"step": 27060
},
{
"epoch": 0.07295040952305706,
"grad_norm": 0.10725018382072449,
"learning_rate": 0.002811003647894426,
"loss": 1.6802,
"step": 27080
},
{
"epoch": 0.07308208896262937,
"grad_norm": 0.07160640507936478,
"learning_rate": 0.0028106958504978113,
"loss": 1.6832,
"step": 27100
},
{
"epoch": 0.07321376840220169,
"grad_norm": 0.09838573634624481,
"learning_rate": 0.0028103878195471915,
"loss": 1.6867,
"step": 27120
},
{
"epoch": 0.07334544784177399,
"grad_norm": 0.08039765805006027,
"learning_rate": 0.0028100795550974555,
"loss": 1.6859,
"step": 27140
},
{
"epoch": 0.0734771272813463,
"grad_norm": 0.096266008913517,
"learning_rate": 0.0028097710572035327,
"loss": 1.6887,
"step": 27160
},
{
"epoch": 0.0736088067209186,
"grad_norm": 0.08196264505386353,
"learning_rate": 0.0028094623259203953,
"loss": 1.681,
"step": 27180
},
{
"epoch": 0.0737404861604909,
"grad_norm": 0.0661395713686943,
"learning_rate": 0.002809153361303056,
"loss": 1.6812,
"step": 27200
},
{
"epoch": 0.07387216560006321,
"grad_norm": 0.07243622839450836,
"learning_rate": 0.002808844163406569,
"loss": 1.6778,
"step": 27220
},
{
"epoch": 0.07400384503963552,
"grad_norm": 0.06151533126831055,
"learning_rate": 0.002808534732286032,
"loss": 1.684,
"step": 27240
},
{
"epoch": 0.07413552447920782,
"grad_norm": 0.06907381862401962,
"learning_rate": 0.0028082250679965803,
"loss": 1.6891,
"step": 27260
},
{
"epoch": 0.07426720391878013,
"grad_norm": 0.07179991155862808,
"learning_rate": 0.0028079151705933955,
"loss": 1.7013,
"step": 27280
},
{
"epoch": 0.07439888335835243,
"grad_norm": 0.0859934464097023,
"learning_rate": 0.002807605040131698,
"loss": 1.6998,
"step": 27300
},
{
"epoch": 0.07453056279792473,
"grad_norm": 0.05939393863081932,
"learning_rate": 0.0028072946766667497,
"loss": 1.7046,
"step": 27320
},
{
"epoch": 0.07466224223749704,
"grad_norm": 0.08368372917175293,
"learning_rate": 0.0028069840802538546,
"loss": 1.7019,
"step": 27340
},
{
"epoch": 0.07479392167706934,
"grad_norm": 0.06464136391878128,
"learning_rate": 0.0028066732509483584,
"loss": 1.7044,
"step": 27360
},
{
"epoch": 0.07492560111664165,
"grad_norm": 0.08051209896802902,
"learning_rate": 0.002806362188805648,
"loss": 1.7057,
"step": 27380
},
{
"epoch": 0.07505728055621395,
"grad_norm": 0.08102471381425858,
"learning_rate": 0.0028060508938811514,
"loss": 1.6942,
"step": 27400
},
{
"epoch": 0.07518895999578626,
"grad_norm": 0.0877891480922699,
"learning_rate": 0.002805739366230339,
"loss": 1.6992,
"step": 27420
},
{
"epoch": 0.07532063943535856,
"grad_norm": 0.0812918171286583,
"learning_rate": 0.002805427605908722,
"loss": 1.6922,
"step": 27440
},
{
"epoch": 0.07545231887493087,
"grad_norm": 0.07641803473234177,
"learning_rate": 0.0028051156129718538,
"loss": 1.6876,
"step": 27460
},
{
"epoch": 0.07558399831450317,
"grad_norm": 0.12771321833133698,
"learning_rate": 0.0028048033874753277,
"loss": 1.6847,
"step": 27480
},
{
"epoch": 0.07571567775407548,
"grad_norm": 0.06846945732831955,
"learning_rate": 0.00280449092947478,
"loss": 1.6961,
"step": 27500
},
{
"epoch": 0.07584735719364778,
"grad_norm": 0.0757148414850235,
"learning_rate": 0.0028041782390258872,
"loss": 1.6922,
"step": 27520
},
{
"epoch": 0.07597903663322009,
"grad_norm": 0.07266736030578613,
"learning_rate": 0.0028038653161843686,
"loss": 1.6867,
"step": 27540
},
{
"epoch": 0.07611071607279239,
"grad_norm": 0.10380854457616806,
"learning_rate": 0.0028035521610059845,
"loss": 1.686,
"step": 27560
},
{
"epoch": 0.0762423955123647,
"grad_norm": 0.063069187104702,
"learning_rate": 0.0028032387735465354,
"loss": 1.6815,
"step": 27580
},
{
"epoch": 0.076374074951937,
"grad_norm": 0.08514589071273804,
"learning_rate": 0.0028029251538618646,
"loss": 1.6811,
"step": 27600
},
{
"epoch": 0.0765057543915093,
"grad_norm": 0.07171927392482758,
"learning_rate": 0.002802611302007856,
"loss": 1.6866,
"step": 27620
},
{
"epoch": 0.07663743383108161,
"grad_norm": 0.07096509635448456,
"learning_rate": 0.002802297218040436,
"loss": 1.6754,
"step": 27640
},
{
"epoch": 0.07676911327065392,
"grad_norm": 0.07615986466407776,
"learning_rate": 0.0028019829020155696,
"loss": 1.679,
"step": 27660
},
{
"epoch": 0.07690079271022622,
"grad_norm": 0.09297886490821838,
"learning_rate": 0.0028016683539892665,
"loss": 1.6825,
"step": 27680
},
{
"epoch": 0.07703247214979853,
"grad_norm": 0.07821375876665115,
"learning_rate": 0.002801353574017576,
"loss": 1.6857,
"step": 27700
},
{
"epoch": 0.07716415158937083,
"grad_norm": 0.08595246821641922,
"learning_rate": 0.002801038562156589,
"loss": 1.6732,
"step": 27720
},
{
"epoch": 0.07729583102894313,
"grad_norm": 0.08263617008924484,
"learning_rate": 0.0028007233184624385,
"loss": 1.6812,
"step": 27740
},
{
"epoch": 0.07742751046851544,
"grad_norm": 0.06740175932645798,
"learning_rate": 0.002800407842991296,
"loss": 1.6786,
"step": 27760
},
{
"epoch": 0.07755918990808774,
"grad_norm": 0.07347702234983444,
"learning_rate": 0.002800092135799378,
"loss": 1.6849,
"step": 27780
},
{
"epoch": 0.07769086934766006,
"grad_norm": 0.06432320922613144,
"learning_rate": 0.0027997761969429406,
"loss": 1.6729,
"step": 27800
},
{
"epoch": 0.07782254878723237,
"grad_norm": 0.06912487000226974,
"learning_rate": 0.0027994600264782806,
"loss": 1.6729,
"step": 27820
},
{
"epoch": 0.07795422822680467,
"grad_norm": 0.07025229185819626,
"learning_rate": 0.0027991436244617367,
"loss": 1.6717,
"step": 27840
},
{
"epoch": 0.07808590766637698,
"grad_norm": 0.06698182970285416,
"learning_rate": 0.002798826990949689,
"loss": 1.6741,
"step": 27860
},
{
"epoch": 0.07821758710594928,
"grad_norm": 0.07972477376461029,
"learning_rate": 0.0027985101259985594,
"loss": 1.6626,
"step": 27880
},
{
"epoch": 0.07834926654552159,
"grad_norm": 0.08026134967803955,
"learning_rate": 0.0027981930296648084,
"loss": 1.6533,
"step": 27900
},
{
"epoch": 0.07848094598509389,
"grad_norm": 0.07009740173816681,
"learning_rate": 0.002797875702004942,
"loss": 1.6447,
"step": 27920
},
{
"epoch": 0.0786126254246662,
"grad_norm": 0.0895591527223587,
"learning_rate": 0.002797558143075504,
"loss": 1.6316,
"step": 27940
},
{
"epoch": 0.0787443048642385,
"grad_norm": 0.07302293926477432,
"learning_rate": 0.00279724035293308,
"loss": 1.6278,
"step": 27960
},
{
"epoch": 0.0788759843038108,
"grad_norm": 0.06689465790987015,
"learning_rate": 0.002796922331634298,
"loss": 1.6277,
"step": 27980
},
{
"epoch": 0.07900766374338311,
"grad_norm": 0.12900836765766144,
"learning_rate": 0.002796604079235826,
"loss": 1.6216,
"step": 28000
},
{
"epoch": 0.07900766374338311,
"eval_loss": 1.57399582862854,
"eval_runtime": 67.3732,
"eval_samples_per_second": 14.843,
"eval_steps_per_second": 14.843,
"step": 28000
},
{
"epoch": 0.07913934318295542,
"grad_norm": 0.09559524804353714,
"learning_rate": 0.002796285595794375,
"loss": 1.6188,
"step": 28020
},
{
"epoch": 0.07927102262252772,
"grad_norm": 0.09647485613822937,
"learning_rate": 0.002795966881366694,
"loss": 1.6111,
"step": 28040
},
{
"epoch": 0.07940270206210003,
"grad_norm": 0.0804126113653183,
"learning_rate": 0.002795647936009576,
"loss": 1.624,
"step": 28060
},
{
"epoch": 0.07953438150167233,
"grad_norm": 0.1041126698255539,
"learning_rate": 0.0027953287597798538,
"loss": 1.6142,
"step": 28080
},
{
"epoch": 0.07966606094124463,
"grad_norm": 0.070301353931427,
"learning_rate": 0.002795009352734402,
"loss": 1.6135,
"step": 28100
},
{
"epoch": 0.07979774038081694,
"grad_norm": 0.07575052231550217,
"learning_rate": 0.0027946897149301354,
"loss": 1.6113,
"step": 28120
},
{
"epoch": 0.07992941982038924,
"grad_norm": 0.0882832482457161,
"learning_rate": 0.0027943698464240117,
"loss": 1.6073,
"step": 28140
},
{
"epoch": 0.08006109925996155,
"grad_norm": 0.07412759959697723,
"learning_rate": 0.002794049747273027,
"loss": 1.6025,
"step": 28160
},
{
"epoch": 0.08019277869953385,
"grad_norm": 0.10568110644817352,
"learning_rate": 0.002793729417534221,
"loss": 1.6053,
"step": 28180
},
{
"epoch": 0.08032445813910616,
"grad_norm": 0.07552295923233032,
"learning_rate": 0.002793408857264674,
"loss": 1.6057,
"step": 28200
},
{
"epoch": 0.08045613757867846,
"grad_norm": 0.07230095565319061,
"learning_rate": 0.0027930880665215057,
"loss": 1.6072,
"step": 28220
},
{
"epoch": 0.08058781701825077,
"grad_norm": 0.07529731094837189,
"learning_rate": 0.002792767045361879,
"loss": 1.6136,
"step": 28240
},
{
"epoch": 0.08071949645782307,
"grad_norm": 0.08432866632938385,
"learning_rate": 0.0027924457938429967,
"loss": 1.6122,
"step": 28260
},
{
"epoch": 0.08085117589739538,
"grad_norm": 0.08389344066381454,
"learning_rate": 0.002792124312022102,
"loss": 1.6049,
"step": 28280
},
{
"epoch": 0.08098285533696768,
"grad_norm": 0.08148514479398727,
"learning_rate": 0.0027918025999564815,
"loss": 1.6022,
"step": 28300
},
{
"epoch": 0.08111453477653999,
"grad_norm": 0.07762300223112106,
"learning_rate": 0.00279148065770346,
"loss": 1.6088,
"step": 28320
},
{
"epoch": 0.08124621421611229,
"grad_norm": 0.08115459978580475,
"learning_rate": 0.0027911584853204056,
"loss": 1.6068,
"step": 28340
},
{
"epoch": 0.0813778936556846,
"grad_norm": 0.08367536962032318,
"learning_rate": 0.0027908360828647265,
"loss": 1.5971,
"step": 28360
},
{
"epoch": 0.0815095730952569,
"grad_norm": 0.08000832796096802,
"learning_rate": 0.002790513450393871,
"loss": 1.6084,
"step": 28380
},
{
"epoch": 0.0816412525348292,
"grad_norm": 0.08210103958845139,
"learning_rate": 0.00279019058796533,
"loss": 1.6077,
"step": 28400
},
{
"epoch": 0.08177293197440151,
"grad_norm": 0.07329817861318588,
"learning_rate": 0.002789867495636635,
"loss": 1.61,
"step": 28420
},
{
"epoch": 0.08190461141397382,
"grad_norm": 0.06839757412672043,
"learning_rate": 0.002789544173465357,
"loss": 1.6128,
"step": 28440
},
{
"epoch": 0.08203629085354612,
"grad_norm": 0.06943529099225998,
"learning_rate": 0.002789220621509109,
"loss": 1.6285,
"step": 28460
},
{
"epoch": 0.08216797029311844,
"grad_norm": 0.10486973077058792,
"learning_rate": 0.0027888968398255467,
"loss": 1.6335,
"step": 28480
},
{
"epoch": 0.08229964973269074,
"grad_norm": 0.07937227934598923,
"learning_rate": 0.0027885728284723628,
"loss": 1.6372,
"step": 28500
},
{
"epoch": 0.08243132917226305,
"grad_norm": 0.07697343081235886,
"learning_rate": 0.002788248587507295,
"loss": 1.6282,
"step": 28520
},
{
"epoch": 0.08256300861183535,
"grad_norm": 0.08481860160827637,
"learning_rate": 0.0027879241169881186,
"loss": 1.6265,
"step": 28540
},
{
"epoch": 0.08269468805140766,
"grad_norm": 0.08266434073448181,
"learning_rate": 0.0027875994169726526,
"loss": 1.628,
"step": 28560
},
{
"epoch": 0.08282636749097996,
"grad_norm": 0.07758313417434692,
"learning_rate": 0.0027872744875187547,
"loss": 1.6168,
"step": 28580
},
{
"epoch": 0.08295804693055227,
"grad_norm": 0.07969856262207031,
"learning_rate": 0.002786949328684325,
"loss": 1.6218,
"step": 28600
},
{
"epoch": 0.08308972637012457,
"grad_norm": 0.06928009539842606,
"learning_rate": 0.002786623940527303,
"loss": 1.614,
"step": 28620
},
{
"epoch": 0.08322140580969688,
"grad_norm": 0.08013467490673065,
"learning_rate": 0.0027862983231056707,
"loss": 1.6131,
"step": 28640
},
{
"epoch": 0.08335308524926918,
"grad_norm": 0.07733161002397537,
"learning_rate": 0.0027859724764774494,
"loss": 1.6108,
"step": 28660
},
{
"epoch": 0.08348476468884149,
"grad_norm": 0.10586979240179062,
"learning_rate": 0.0027856464007007028,
"loss": 1.6141,
"step": 28680
},
{
"epoch": 0.08361644412841379,
"grad_norm": 0.07554934173822403,
"learning_rate": 0.002785320095833534,
"loss": 1.6104,
"step": 28700
},
{
"epoch": 0.0837481235679861,
"grad_norm": 0.08737286925315857,
"learning_rate": 0.0027849935619340873,
"loss": 1.6126,
"step": 28720
},
{
"epoch": 0.0838798030075584,
"grad_norm": 0.07767580449581146,
"learning_rate": 0.002784666799060549,
"loss": 1.6056,
"step": 28740
},
{
"epoch": 0.0840114824471307,
"grad_norm": 0.09215500950813293,
"learning_rate": 0.0027843398072711447,
"loss": 1.605,
"step": 28760
},
{
"epoch": 0.08414316188670301,
"grad_norm": 0.09147578477859497,
"learning_rate": 0.002784012586624141,
"loss": 1.6081,
"step": 28780
},
{
"epoch": 0.08427484132627532,
"grad_norm": 0.09132102876901627,
"learning_rate": 0.002783685137177846,
"loss": 1.6054,
"step": 28800
},
{
"epoch": 0.08440652076584762,
"grad_norm": 0.09715555608272552,
"learning_rate": 0.0027833574589906087,
"loss": 1.6011,
"step": 28820
},
{
"epoch": 0.08453820020541992,
"grad_norm": 0.09655196219682693,
"learning_rate": 0.0027830295521208176,
"loss": 1.602,
"step": 28840
},
{
"epoch": 0.08466987964499223,
"grad_norm": 0.09575804322957993,
"learning_rate": 0.002782701416626903,
"loss": 1.606,
"step": 28860
},
{
"epoch": 0.08480155908456453,
"grad_norm": 0.08992674201726913,
"learning_rate": 0.002782373052567336,
"loss": 1.6016,
"step": 28880
},
{
"epoch": 0.08493323852413684,
"grad_norm": 0.13212674856185913,
"learning_rate": 0.002782044460000627,
"loss": 1.6017,
"step": 28900
},
{
"epoch": 0.08506491796370914,
"grad_norm": 0.08106255531311035,
"learning_rate": 0.002781715638985329,
"loss": 1.6053,
"step": 28920
},
{
"epoch": 0.08519659740328145,
"grad_norm": 0.09823165833950043,
"learning_rate": 0.002781386589580035,
"loss": 1.6067,
"step": 28940
},
{
"epoch": 0.08532827684285375,
"grad_norm": 0.07196325063705444,
"learning_rate": 0.002781057311843379,
"loss": 1.6017,
"step": 28960
},
{
"epoch": 0.08545995628242606,
"grad_norm": 0.0797024518251419,
"learning_rate": 0.0027807278058340334,
"loss": 1.6051,
"step": 28980
},
{
"epoch": 0.08559163572199836,
"grad_norm": 0.08300334960222244,
"learning_rate": 0.0027803980716107147,
"loss": 1.6088,
"step": 29000
},
{
"epoch": 0.08559163572199836,
"eval_loss": 1.4939472675323486,
"eval_runtime": 71.0831,
"eval_samples_per_second": 14.068,
"eval_steps_per_second": 14.068,
"step": 29000
},
{
"epoch": 0.08572331516157067,
"grad_norm": 0.07488060742616653,
"learning_rate": 0.0027800681092321785,
"loss": 1.6085,
"step": 29020
},
{
"epoch": 0.08585499460114297,
"grad_norm": 0.07563740015029907,
"learning_rate": 0.0027797379187572205,
"loss": 1.6419,
"step": 29040
},
{
"epoch": 0.08598667404071528,
"grad_norm": 0.07274390012025833,
"learning_rate": 0.0027794075002446775,
"loss": 1.6611,
"step": 29060
},
{
"epoch": 0.08611835348028758,
"grad_norm": 0.07751382887363434,
"learning_rate": 0.0027790768537534283,
"loss": 1.6802,
"step": 29080
},
{
"epoch": 0.08625003291985989,
"grad_norm": 0.08200586587190628,
"learning_rate": 0.0027787459793423897,
"loss": 1.6833,
"step": 29100
},
{
"epoch": 0.08638171235943219,
"grad_norm": 0.07423494756221771,
"learning_rate": 0.002778414877070521,
"loss": 1.6816,
"step": 29120
},
{
"epoch": 0.08651339179900451,
"grad_norm": 0.09629736840724945,
"learning_rate": 0.002778083546996822,
"loss": 1.6779,
"step": 29140
},
{
"epoch": 0.08664507123857682,
"grad_norm": 0.09053540974855423,
"learning_rate": 0.002777751989180333,
"loss": 1.6756,
"step": 29160
},
{
"epoch": 0.08677675067814912,
"grad_norm": 0.08008238673210144,
"learning_rate": 0.0027774202036801323,
"loss": 1.6745,
"step": 29180
},
{
"epoch": 0.08690843011772142,
"grad_norm": 0.07499855756759644,
"learning_rate": 0.0027770881905553432,
"loss": 1.669,
"step": 29200
},
{
"epoch": 0.08704010955729373,
"grad_norm": 0.08784040063619614,
"learning_rate": 0.002776755949865127,
"loss": 1.6681,
"step": 29220
},
{
"epoch": 0.08717178899686603,
"grad_norm": 0.10526277124881744,
"learning_rate": 0.0027764234816686864,
"loss": 1.6645,
"step": 29240
},
{
"epoch": 0.08730346843643834,
"grad_norm": 0.08847960829734802,
"learning_rate": 0.0027760907860252624,
"loss": 1.659,
"step": 29260
},
{
"epoch": 0.08743514787601064,
"grad_norm": 0.09215822070837021,
"learning_rate": 0.00277575786299414,
"loss": 1.6612,
"step": 29280
},
{
"epoch": 0.08756682731558295,
"grad_norm": 0.08477826416492462,
"learning_rate": 0.002775424712634642,
"loss": 1.6656,
"step": 29300
},
{
"epoch": 0.08769850675515525,
"grad_norm": 0.07661165297031403,
"learning_rate": 0.002775091335006134,
"loss": 1.6627,
"step": 29320
},
{
"epoch": 0.08783018619472756,
"grad_norm": 0.06484279781579971,
"learning_rate": 0.0027747577301680195,
"loss": 1.6595,
"step": 29340
},
{
"epoch": 0.08796186563429986,
"grad_norm": 0.0724259540438652,
"learning_rate": 0.0027744238981797452,
"loss": 1.6561,
"step": 29360
},
{
"epoch": 0.08809354507387217,
"grad_norm": 0.07707709074020386,
"learning_rate": 0.0027740898391007958,
"loss": 1.6538,
"step": 29380
},
{
"epoch": 0.08822522451344447,
"grad_norm": 0.08440696448087692,
"learning_rate": 0.002773755552990697,
"loss": 1.6546,
"step": 29400
},
{
"epoch": 0.08835690395301678,
"grad_norm": 0.07948070019483566,
"learning_rate": 0.0027734210399090174,
"loss": 1.6462,
"step": 29420
},
{
"epoch": 0.08848858339258908,
"grad_norm": 0.08475562930107117,
"learning_rate": 0.002773086299915363,
"loss": 1.6494,
"step": 29440
},
{
"epoch": 0.08862026283216139,
"grad_norm": 0.0809844508767128,
"learning_rate": 0.0027727513330693815,
"loss": 1.6581,
"step": 29460
},
{
"epoch": 0.08875194227173369,
"grad_norm": 0.07043874263763428,
"learning_rate": 0.002772416139430761,
"loss": 1.6499,
"step": 29480
},
{
"epoch": 0.088883621711306,
"grad_norm": 0.079310841858387,
"learning_rate": 0.0027720807190592302,
"loss": 1.6508,
"step": 29500
},
{
"epoch": 0.0890153011508783,
"grad_norm": 0.07824884355068207,
"learning_rate": 0.002771745072014558,
"loss": 1.6486,
"step": 29520
},
{
"epoch": 0.0891469805904506,
"grad_norm": 0.06876828521490097,
"learning_rate": 0.0027714091983565524,
"loss": 1.6493,
"step": 29540
},
{
"epoch": 0.08927866003002291,
"grad_norm": 0.09782326221466064,
"learning_rate": 0.0027710730981450643,
"loss": 1.654,
"step": 29560
},
{
"epoch": 0.08941033946959522,
"grad_norm": 0.08521437644958496,
"learning_rate": 0.0027707367714399837,
"loss": 1.6469,
"step": 29580
},
{
"epoch": 0.08954201890916752,
"grad_norm": 0.07844710350036621,
"learning_rate": 0.0027704002183012405,
"loss": 1.6494,
"step": 29600
},
{
"epoch": 0.08967369834873982,
"grad_norm": 0.09010956436395645,
"learning_rate": 0.002770063438788805,
"loss": 1.6534,
"step": 29620
},
{
"epoch": 0.08980537778831213,
"grad_norm": 0.07454434037208557,
"learning_rate": 0.002769726432962689,
"loss": 1.668,
"step": 29640
},
{
"epoch": 0.08993705722788443,
"grad_norm": 0.09403835237026215,
"learning_rate": 0.0027693892008829437,
"loss": 1.6764,
"step": 29660
},
{
"epoch": 0.09006873666745674,
"grad_norm": 0.09171565622091293,
"learning_rate": 0.0027690517426096606,
"loss": 1.6795,
"step": 29680
},
{
"epoch": 0.09020041610702904,
"grad_norm": 0.08323973417282104,
"learning_rate": 0.0027687140582029713,
"loss": 1.6813,
"step": 29700
},
{
"epoch": 0.09033209554660135,
"grad_norm": 0.06903329491615295,
"learning_rate": 0.0027683761477230485,
"loss": 1.6718,
"step": 29720
},
{
"epoch": 0.09046377498617365,
"grad_norm": 0.06989486515522003,
"learning_rate": 0.002768038011230105,
"loss": 1.6684,
"step": 29740
},
{
"epoch": 0.09059545442574596,
"grad_norm": 0.08322389423847198,
"learning_rate": 0.002767699648784393,
"loss": 1.6708,
"step": 29760
},
{
"epoch": 0.09072713386531826,
"grad_norm": 0.09357618540525436,
"learning_rate": 0.002767361060446206,
"loss": 1.6716,
"step": 29780
},
{
"epoch": 0.09085881330489057,
"grad_norm": 0.08602355420589447,
"learning_rate": 0.0027670222462758774,
"loss": 1.6658,
"step": 29800
},
{
"epoch": 0.09099049274446289,
"grad_norm": 0.07419178634881973,
"learning_rate": 0.0027666832063337806,
"loss": 1.6682,
"step": 29820
},
{
"epoch": 0.09112217218403519,
"grad_norm": 0.09919148683547974,
"learning_rate": 0.0027663439406803293,
"loss": 1.6616,
"step": 29840
},
{
"epoch": 0.0912538516236075,
"grad_norm": 0.07616308331489563,
"learning_rate": 0.002766004449375978,
"loss": 1.661,
"step": 29860
},
{
"epoch": 0.0913855310631798,
"grad_norm": 0.0842098742723465,
"learning_rate": 0.002765664732481221,
"loss": 1.6573,
"step": 29880
},
{
"epoch": 0.0915172105027521,
"grad_norm": 0.09518759697675705,
"learning_rate": 0.002765324790056592,
"loss": 1.6638,
"step": 29900
},
{
"epoch": 0.09164888994232441,
"grad_norm": 0.07474862039089203,
"learning_rate": 0.002764984622162666,
"loss": 1.66,
"step": 29920
},
{
"epoch": 0.09178056938189671,
"grad_norm": 0.17661775648593903,
"learning_rate": 0.0027646442288600578,
"loss": 1.6541,
"step": 29940
},
{
"epoch": 0.09191224882146902,
"grad_norm": 0.1082674190402031,
"learning_rate": 0.002764303610209422,
"loss": 1.6583,
"step": 29960
},
{
"epoch": 0.09204392826104132,
"grad_norm": 0.0656692162156105,
"learning_rate": 0.0027639627662714547,
"loss": 1.6548,
"step": 29980
},
{
"epoch": 0.09217560770061363,
"grad_norm": 0.06664387881755829,
"learning_rate": 0.0027636216971068904,
"loss": 1.6536,
"step": 30000
},
{
"epoch": 0.09217560770061363,
"eval_loss": 1.593057632446289,
"eval_runtime": 66.8776,
"eval_samples_per_second": 14.953,
"eval_steps_per_second": 14.953,
"step": 30000
},
{
"epoch": 0.09230728714018593,
"grad_norm": 0.11122573167085648,
"learning_rate": 0.0027632804027765048,
"loss": 1.6526,
"step": 30020
},
{
"epoch": 0.09243896657975824,
"grad_norm": 0.08378654718399048,
"learning_rate": 0.0027629388833411133,
"loss": 1.6516,
"step": 30040
},
{
"epoch": 0.09257064601933054,
"grad_norm": 0.0903952419757843,
"learning_rate": 0.0027625971388615714,
"loss": 1.6495,
"step": 30060
},
{
"epoch": 0.09270232545890285,
"grad_norm": 0.10157206654548645,
"learning_rate": 0.002762255169398775,
"loss": 1.6479,
"step": 30080
},
{
"epoch": 0.09283400489847515,
"grad_norm": 0.06507019698619843,
"learning_rate": 0.00276191297501366,
"loss": 1.651,
"step": 30100
},
{
"epoch": 0.09296568433804746,
"grad_norm": 0.07820893824100494,
"learning_rate": 0.0027615705557672023,
"loss": 1.6566,
"step": 30120
},
{
"epoch": 0.09309736377761976,
"grad_norm": 0.07816014438867569,
"learning_rate": 0.002761227911720418,
"loss": 1.6532,
"step": 30140
},
{
"epoch": 0.09322904321719207,
"grad_norm": 0.10330802947282791,
"learning_rate": 0.002760885042934363,
"loss": 1.6467,
"step": 30160
},
{
"epoch": 0.09336072265676437,
"grad_norm": 0.07946458458900452,
"learning_rate": 0.0027605419494701328,
"loss": 1.651,
"step": 30180
},
{
"epoch": 0.09349240209633668,
"grad_norm": 0.08045420050621033,
"learning_rate": 0.002760198631388864,
"loss": 1.6483,
"step": 30200
},
{
"epoch": 0.09362408153590898,
"grad_norm": 0.08808773756027222,
"learning_rate": 0.0027598550887517333,
"loss": 1.6419,
"step": 30220
},
{
"epoch": 0.09375576097548129,
"grad_norm": 0.12588857114315033,
"learning_rate": 0.002759511321619956,
"loss": 1.6357,
"step": 30240
},
{
"epoch": 0.09388744041505359,
"grad_norm": 0.07971849292516708,
"learning_rate": 0.002759167330054789,
"loss": 1.6015,
"step": 30260
},
{
"epoch": 0.0940191198546259,
"grad_norm": 0.09091313183307648,
"learning_rate": 0.002758823114117527,
"loss": 1.6004,
"step": 30280
},
{
"epoch": 0.0941507992941982,
"grad_norm": 0.0841759741306305,
"learning_rate": 0.0027584786738695083,
"loss": 1.5936,
"step": 30300
},
{
"epoch": 0.0942824787337705,
"grad_norm": 0.09897656738758087,
"learning_rate": 0.0027581340093721075,
"loss": 1.5878,
"step": 30320
},
{
"epoch": 0.09441415817334281,
"grad_norm": 0.09095700830221176,
"learning_rate": 0.002757789120686741,
"loss": 1.5916,
"step": 30340
},
{
"epoch": 0.09454583761291512,
"grad_norm": 0.07832010090351105,
"learning_rate": 0.0027574440078748648,
"loss": 1.589,
"step": 30360
},
{
"epoch": 0.09467751705248742,
"grad_norm": 0.07373721152544022,
"learning_rate": 0.0027570986709979746,
"loss": 1.5799,
"step": 30380
},
{
"epoch": 0.09480919649205972,
"grad_norm": 0.07081932574510574,
"learning_rate": 0.002756753110117607,
"loss": 1.5791,
"step": 30400
},
{
"epoch": 0.09494087593163203,
"grad_norm": 0.08223600685596466,
"learning_rate": 0.0027564073252953373,
"loss": 1.5766,
"step": 30420
},
{
"epoch": 0.09507255537120433,
"grad_norm": 0.08098476380109787,
"learning_rate": 0.002756061316592781,
"loss": 1.5818,
"step": 30440
},
{
"epoch": 0.09520423481077664,
"grad_norm": 0.07812890410423279,
"learning_rate": 0.002755715084071594,
"loss": 1.5761,
"step": 30460
},
{
"epoch": 0.09533591425034894,
"grad_norm": 0.07554410398006439,
"learning_rate": 0.002755368627793472,
"loss": 1.5781,
"step": 30480
},
{
"epoch": 0.09546759368992126,
"grad_norm": 0.08680091798305511,
"learning_rate": 0.002755021947820149,
"loss": 1.5784,
"step": 30500
},
{
"epoch": 0.09559927312949357,
"grad_norm": 0.08017537742853165,
"learning_rate": 0.002754675044213402,
"loss": 1.578,
"step": 30520
},
{
"epoch": 0.09573095256906587,
"grad_norm": 0.08503107726573944,
"learning_rate": 0.002754327917035045,
"loss": 1.5727,
"step": 30540
},
{
"epoch": 0.09586263200863818,
"grad_norm": 0.09204825013875961,
"learning_rate": 0.002753980566346934,
"loss": 1.5775,
"step": 30560
},
{
"epoch": 0.09599431144821048,
"grad_norm": 0.07686753571033478,
"learning_rate": 0.0027536329922109616,
"loss": 1.5747,
"step": 30580
},
{
"epoch": 0.09612599088778279,
"grad_norm": 0.08408256620168686,
"learning_rate": 0.002753285194689064,
"loss": 1.5722,
"step": 30600
},
{
"epoch": 0.09625767032735509,
"grad_norm": 0.09992122650146484,
"learning_rate": 0.0027529371738432154,
"loss": 1.5725,
"step": 30620
},
{
"epoch": 0.0963893497669274,
"grad_norm": 0.07421014457941055,
"learning_rate": 0.0027525889297354295,
"loss": 1.5709,
"step": 30640
},
{
"epoch": 0.0965210292064997,
"grad_norm": 0.08402437716722488,
"learning_rate": 0.0027522404624277606,
"loss": 1.5711,
"step": 30660
},
{
"epoch": 0.096652708646072,
"grad_norm": 0.10464178025722504,
"learning_rate": 0.0027518917719823017,
"loss": 1.5724,
"step": 30680
},
{
"epoch": 0.09678438808564431,
"grad_norm": 0.09930146485567093,
"learning_rate": 0.002751542858461187,
"loss": 1.5768,
"step": 30700
},
{
"epoch": 0.09691606752521661,
"grad_norm": 0.08711190521717072,
"learning_rate": 0.0027511937219265896,
"loss": 1.5783,
"step": 30720
},
{
"epoch": 0.09704774696478892,
"grad_norm": 0.07746979594230652,
"learning_rate": 0.0027508443624407217,
"loss": 1.5724,
"step": 30740
},
{
"epoch": 0.09717942640436122,
"grad_norm": 0.09594020992517471,
"learning_rate": 0.0027504947800658366,
"loss": 1.5755,
"step": 30760
},
{
"epoch": 0.09731110584393353,
"grad_norm": 0.0837220624089241,
"learning_rate": 0.002750144974864227,
"loss": 1.5692,
"step": 30780
},
{
"epoch": 0.09744278528350583,
"grad_norm": 0.07753045111894608,
"learning_rate": 0.0027497949468982237,
"loss": 1.5723,
"step": 30800
},
{
"epoch": 0.09757446472307814,
"grad_norm": 0.0966426357626915,
"learning_rate": 0.0027494446962302004,
"loss": 1.5948,
"step": 30820
},
{
"epoch": 0.09770614416265044,
"grad_norm": 0.0724552646279335,
"learning_rate": 0.002749094222922567,
"loss": 1.6,
"step": 30840
},
{
"epoch": 0.09783782360222275,
"grad_norm": 0.07575785368680954,
"learning_rate": 0.002748743527037775,
"loss": 1.6046,
"step": 30860
},
{
"epoch": 0.09796950304179505,
"grad_norm": 0.10300685465335846,
"learning_rate": 0.0027483926086383156,
"loss": 1.6014,
"step": 30880
},
{
"epoch": 0.09810118248136736,
"grad_norm": 0.07341894507408142,
"learning_rate": 0.0027480414677867188,
"loss": 1.6002,
"step": 30900
},
{
"epoch": 0.09823286192093966,
"grad_norm": 0.09823710471391678,
"learning_rate": 0.002747690104545555,
"loss": 1.5955,
"step": 30920
},
{
"epoch": 0.09836454136051197,
"grad_norm": 0.08126625418663025,
"learning_rate": 0.0027473385189774337,
"loss": 1.5951,
"step": 30940
},
{
"epoch": 0.09849622080008427,
"grad_norm": 0.08654072135686874,
"learning_rate": 0.0027469867111450043,
"loss": 1.592,
"step": 30960
},
{
"epoch": 0.09862790023965658,
"grad_norm": 0.08610561490058899,
"learning_rate": 0.002746634681110956,
"loss": 1.5866,
"step": 30980
},
{
"epoch": 0.09875957967922888,
"grad_norm": 0.10982340574264526,
"learning_rate": 0.0027462824289380167,
"loss": 1.5916,
"step": 31000
},
{
"epoch": 0.09875957967922888,
"eval_loss": 1.4958887100219727,
"eval_runtime": 65.9246,
"eval_samples_per_second": 15.169,
"eval_steps_per_second": 15.169,
"step": 31000
},
{
"epoch": 0.09889125911880119,
"grad_norm": 0.08077514916658401,
"learning_rate": 0.002745929954688955,
"loss": 1.5905,
"step": 31020
},
{
"epoch": 0.09902293855837349,
"grad_norm": 0.08327169716358185,
"learning_rate": 0.0027455772584265782,
"loss": 1.5853,
"step": 31040
},
{
"epoch": 0.0991546179979458,
"grad_norm": 0.07334230840206146,
"learning_rate": 0.0027452243402137345,
"loss": 1.5903,
"step": 31060
},
{
"epoch": 0.0992862974375181,
"grad_norm": 0.0786149725317955,
"learning_rate": 0.0027448712001133095,
"loss": 1.5844,
"step": 31080
},
{
"epoch": 0.0994179768770904,
"grad_norm": 0.08628056943416595,
"learning_rate": 0.00274451783818823,
"loss": 1.5821,
"step": 31100
},
{
"epoch": 0.09954965631666271,
"grad_norm": 0.09965677559375763,
"learning_rate": 0.0027441642545014623,
"loss": 1.5788,
"step": 31120
},
{
"epoch": 0.09968133575623501,
"grad_norm": 0.09084340184926987,
"learning_rate": 0.002743810449116011,
"loss": 1.5821,
"step": 31140
},
{
"epoch": 0.09981301519580732,
"grad_norm": 0.08165693283081055,
"learning_rate": 0.002743456422094922,
"loss": 1.5779,
"step": 31160
},
{
"epoch": 0.09994469463537964,
"grad_norm": 0.08033919334411621,
"learning_rate": 0.002743102173501278,
"loss": 1.5799,
"step": 31180
},
{
"epoch": 0.10007637407495194,
"grad_norm": 0.09969887882471085,
"learning_rate": 0.0027427477033982045,
"loss": 1.577,
"step": 31200
},
{
"epoch": 0.10020805351452425,
"grad_norm": 0.08198243379592896,
"learning_rate": 0.0027423930118488644,
"loss": 1.5756,
"step": 31220
},
{
"epoch": 0.10033973295409655,
"grad_norm": 0.08875197172164917,
"learning_rate": 0.00274203809891646,
"loss": 1.5766,
"step": 31240
},
{
"epoch": 0.10047141239366886,
"grad_norm": 0.07156415283679962,
"learning_rate": 0.002741682964664234,
"loss": 1.5795,
"step": 31260
},
{
"epoch": 0.10060309183324116,
"grad_norm": 0.1065966859459877,
"learning_rate": 0.0027413276091554683,
"loss": 1.5865,
"step": 31280
},
{
"epoch": 0.10073477127281347,
"grad_norm": 0.08343872427940369,
"learning_rate": 0.0027409720324534834,
"loss": 1.58,
"step": 31300
},
{
"epoch": 0.10086645071238577,
"grad_norm": 0.08024212718009949,
"learning_rate": 0.00274061623462164,
"loss": 1.5828,
"step": 31320
},
{
"epoch": 0.10099813015195808,
"grad_norm": 0.08566683530807495,
"learning_rate": 0.0027402602157233376,
"loss": 1.5695,
"step": 31340
},
{
"epoch": 0.10112980959153038,
"grad_norm": 0.08198649436235428,
"learning_rate": 0.002739903975822016,
"loss": 1.5811,
"step": 31360
},
{
"epoch": 0.10126148903110269,
"grad_norm": 0.10375852882862091,
"learning_rate": 0.0027395475149811542,
"loss": 1.5786,
"step": 31380
},
{
"epoch": 0.10139316847067499,
"grad_norm": 0.11077110469341278,
"learning_rate": 0.0027391908332642704,
"loss": 1.5964,
"step": 31400
},
{
"epoch": 0.1015248479102473,
"grad_norm": 0.08183398842811584,
"learning_rate": 0.0027388339307349205,
"loss": 1.6251,
"step": 31420
},
{
"epoch": 0.1016565273498196,
"grad_norm": 0.08363300561904907,
"learning_rate": 0.002738476807456703,
"loss": 1.6606,
"step": 31440
},
{
"epoch": 0.1017882067893919,
"grad_norm": 0.07447555661201477,
"learning_rate": 0.0027381194634932536,
"loss": 1.6706,
"step": 31460
},
{
"epoch": 0.10191988622896421,
"grad_norm": 0.10050380229949951,
"learning_rate": 0.0027377618989082465,
"loss": 1.6575,
"step": 31480
},
{
"epoch": 0.10205156566853651,
"grad_norm": 0.07040868699550629,
"learning_rate": 0.002737404113765398,
"loss": 1.6624,
"step": 31500
},
{
"epoch": 0.10218324510810882,
"grad_norm": 0.08749683946371078,
"learning_rate": 0.002737046108128461,
"loss": 1.6537,
"step": 31520
},
{
"epoch": 0.10231492454768112,
"grad_norm": 0.09317103773355484,
"learning_rate": 0.00273668788206123,
"loss": 1.6564,
"step": 31540
},
{
"epoch": 0.10244660398725343,
"grad_norm": 0.07827817648649216,
"learning_rate": 0.0027363294356275367,
"loss": 1.6535,
"step": 31560
},
{
"epoch": 0.10257828342682573,
"grad_norm": 0.08093781024217606,
"learning_rate": 0.002735970768891253,
"loss": 1.643,
"step": 31580
},
{
"epoch": 0.10270996286639804,
"grad_norm": 0.08157644420862198,
"learning_rate": 0.00273561188191629,
"loss": 1.6449,
"step": 31600
},
{
"epoch": 0.10284164230597034,
"grad_norm": 0.09422040730714798,
"learning_rate": 0.0027352527747665986,
"loss": 1.6457,
"step": 31620
},
{
"epoch": 0.10297332174554265,
"grad_norm": 0.08076277375221252,
"learning_rate": 0.0027348934475061684,
"loss": 1.641,
"step": 31640
},
{
"epoch": 0.10310500118511495,
"grad_norm": 0.09262409806251526,
"learning_rate": 0.0027345339001990272,
"loss": 1.6404,
"step": 31660
},
{
"epoch": 0.10323668062468726,
"grad_norm": 0.08169291168451309,
"learning_rate": 0.0027341741329092446,
"loss": 1.6405,
"step": 31680
},
{
"epoch": 0.10336836006425956,
"grad_norm": 0.07819892466068268,
"learning_rate": 0.002733814145700927,
"loss": 1.6315,
"step": 31700
},
{
"epoch": 0.10350003950383187,
"grad_norm": 0.07450778037309647,
"learning_rate": 0.00273345393863822,
"loss": 1.6268,
"step": 31720
},
{
"epoch": 0.10363171894340417,
"grad_norm": 0.08458829671144485,
"learning_rate": 0.0027330935117853106,
"loss": 1.6344,
"step": 31740
},
{
"epoch": 0.10376339838297648,
"grad_norm": 0.07392025738954544,
"learning_rate": 0.0027327328652064233,
"loss": 1.6322,
"step": 31760
},
{
"epoch": 0.10389507782254878,
"grad_norm": 0.09063839167356491,
"learning_rate": 0.002732371998965821,
"loss": 1.636,
"step": 31780
},
{
"epoch": 0.10402675726212109,
"grad_norm": 0.09151460975408554,
"learning_rate": 0.002732010913127808,
"loss": 1.6305,
"step": 31800
},
{
"epoch": 0.10415843670169339,
"grad_norm": 0.07469334453344345,
"learning_rate": 0.002731649607756726,
"loss": 1.6291,
"step": 31820
},
{
"epoch": 0.10429011614126571,
"grad_norm": 0.07378929853439331,
"learning_rate": 0.0027312880829169564,
"loss": 1.6337,
"step": 31840
},
{
"epoch": 0.10442179558083801,
"grad_norm": 0.08763482421636581,
"learning_rate": 0.002730926338672919,
"loss": 1.6221,
"step": 31860
},
{
"epoch": 0.10455347502041032,
"grad_norm": 0.09730922430753708,
"learning_rate": 0.0027305643750890744,
"loss": 1.6251,
"step": 31880
},
{
"epoch": 0.10468515445998262,
"grad_norm": 0.0719449371099472,
"learning_rate": 0.0027302021922299205,
"loss": 1.6316,
"step": 31900
},
{
"epoch": 0.10481683389955493,
"grad_norm": 0.08451465517282486,
"learning_rate": 0.0027298397901599947,
"loss": 1.6271,
"step": 31920
},
{
"epoch": 0.10494851333912723,
"grad_norm": 0.07725101709365845,
"learning_rate": 0.0027294771689438746,
"loss": 1.6333,
"step": 31940
},
{
"epoch": 0.10508019277869954,
"grad_norm": 0.10085799545049667,
"learning_rate": 0.0027291143286461753,
"loss": 1.6231,
"step": 31960
},
{
"epoch": 0.10521187221827184,
"grad_norm": 0.10356923937797546,
"learning_rate": 0.002728751269331552,
"loss": 1.6268,
"step": 31980
},
{
"epoch": 0.10534355165784415,
"grad_norm": 0.0808652937412262,
"learning_rate": 0.0027283879910646983,
"loss": 1.6371,
"step": 32000
},
{
"epoch": 0.10534355165784415,
"eval_loss": 1.5755228996276855,
"eval_runtime": 66.1417,
"eval_samples_per_second": 15.119,
"eval_steps_per_second": 15.119,
"step": 32000
},
{
"epoch": 0.10547523109741645,
"grad_norm": 0.10892391949892044,
"learning_rate": 0.002728024493910347,
"loss": 1.6455,
"step": 32020
},
{
"epoch": 0.10560691053698876,
"grad_norm": 0.08325547724962234,
"learning_rate": 0.00272766077793327,
"loss": 1.6526,
"step": 32040
},
{
"epoch": 0.10573858997656106,
"grad_norm": 0.10805673897266388,
"learning_rate": 0.0027272968431982787,
"loss": 1.6663,
"step": 32060
},
{
"epoch": 0.10587026941613337,
"grad_norm": 0.09780491143465042,
"learning_rate": 0.0027269326897702223,
"loss": 1.6522,
"step": 32080
},
{
"epoch": 0.10600194885570567,
"grad_norm": 0.09470649063587189,
"learning_rate": 0.0027265683177139896,
"loss": 1.6546,
"step": 32100
},
{
"epoch": 0.10613362829527798,
"grad_norm": 0.07851683348417282,
"learning_rate": 0.002726203727094509,
"loss": 1.6458,
"step": 32120
},
{
"epoch": 0.10626530773485028,
"grad_norm": 0.0761096403002739,
"learning_rate": 0.0027258389179767467,
"loss": 1.6525,
"step": 32140
},
{
"epoch": 0.10639698717442259,
"grad_norm": 0.1286764144897461,
"learning_rate": 0.0027254738904257084,
"loss": 1.6486,
"step": 32160
},
{
"epoch": 0.10652866661399489,
"grad_norm": 0.0972808375954628,
"learning_rate": 0.002725108644506438,
"loss": 1.6394,
"step": 32180
},
{
"epoch": 0.1066603460535672,
"grad_norm": 0.07394243031740189,
"learning_rate": 0.0027247431802840207,
"loss": 1.6393,
"step": 32200
},
{
"epoch": 0.1067920254931395,
"grad_norm": 0.07845206558704376,
"learning_rate": 0.0027243774978235775,
"loss": 1.6381,
"step": 32220
},
{
"epoch": 0.1069237049327118,
"grad_norm": 0.07898611575365067,
"learning_rate": 0.00272401159719027,
"loss": 1.6394,
"step": 32240
},
{
"epoch": 0.10705538437228411,
"grad_norm": 0.08906087279319763,
"learning_rate": 0.002723645478449298,
"loss": 1.6368,
"step": 32260
},
{
"epoch": 0.10718706381185641,
"grad_norm": 0.0694982185959816,
"learning_rate": 0.0027232791416659016,
"loss": 1.6367,
"step": 32280
},
{
"epoch": 0.10731874325142872,
"grad_norm": 0.07341042160987854,
"learning_rate": 0.0027229125869053577,
"loss": 1.6301,
"step": 32300
},
{
"epoch": 0.10745042269100102,
"grad_norm": 0.1038580909371376,
"learning_rate": 0.0027225458142329834,
"loss": 1.6339,
"step": 32320
},
{
"epoch": 0.10758210213057333,
"grad_norm": 0.09001409262418747,
"learning_rate": 0.002722178823714134,
"loss": 1.6368,
"step": 32340
},
{
"epoch": 0.10771378157014563,
"grad_norm": 0.07618994265794754,
"learning_rate": 0.0027218116154142037,
"loss": 1.6209,
"step": 32360
},
{
"epoch": 0.10784546100971794,
"grad_norm": 0.08030746132135391,
"learning_rate": 0.0027214441893986256,
"loss": 1.6342,
"step": 32380
},
{
"epoch": 0.10797714044929024,
"grad_norm": 0.07523296028375626,
"learning_rate": 0.0027210765457328723,
"loss": 1.6318,
"step": 32400
},
{
"epoch": 0.10810881988886255,
"grad_norm": 0.08324859291315079,
"learning_rate": 0.0027207086844824543,
"loss": 1.6366,
"step": 32420
},
{
"epoch": 0.10824049932843485,
"grad_norm": 0.09114082902669907,
"learning_rate": 0.002720340605712921,
"loss": 1.6323,
"step": 32440
},
{
"epoch": 0.10837217876800716,
"grad_norm": 0.14000263810157776,
"learning_rate": 0.0027199723094898606,
"loss": 1.6284,
"step": 32460
},
{
"epoch": 0.10850385820757946,
"grad_norm": 0.09753448516130447,
"learning_rate": 0.0027196037958789002,
"loss": 1.633,
"step": 32480
},
{
"epoch": 0.10863553764715177,
"grad_norm": 0.09878184646368027,
"learning_rate": 0.0027192350649457055,
"loss": 1.6316,
"step": 32500
},
{
"epoch": 0.10876721708672409,
"grad_norm": 0.08344288915395737,
"learning_rate": 0.002718866116755981,
"loss": 1.6188,
"step": 32520
},
{
"epoch": 0.10889889652629639,
"grad_norm": 0.09065096825361252,
"learning_rate": 0.00271849695137547,
"loss": 1.6279,
"step": 32540
},
{
"epoch": 0.1090305759658687,
"grad_norm": 0.08262189477682114,
"learning_rate": 0.002718127568869954,
"loss": 1.6301,
"step": 32560
},
{
"epoch": 0.109162255405441,
"grad_norm": 0.11573157459497452,
"learning_rate": 0.002717757969305254,
"loss": 1.6204,
"step": 32580
},
{
"epoch": 0.1092939348450133,
"grad_norm": 0.09369558840990067,
"learning_rate": 0.002717388152747229,
"loss": 1.6258,
"step": 32600
},
{
"epoch": 0.10942561428458561,
"grad_norm": 0.08298981189727783,
"learning_rate": 0.0027170181192617774,
"loss": 1.597,
"step": 32620
},
{
"epoch": 0.10955729372415791,
"grad_norm": 0.0729466900229454,
"learning_rate": 0.0027166478689148355,
"loss": 1.5801,
"step": 32640
},
{
"epoch": 0.10968897316373022,
"grad_norm": 0.08472312241792679,
"learning_rate": 0.002716277401772378,
"loss": 1.574,
"step": 32660
},
{
"epoch": 0.10982065260330252,
"grad_norm": 0.08250225335359573,
"learning_rate": 0.00271590671790042,
"loss": 1.5731,
"step": 32680
},
{
"epoch": 0.10995233204287483,
"grad_norm": 0.07867790013551712,
"learning_rate": 0.0027155358173650123,
"loss": 1.5637,
"step": 32700
},
{
"epoch": 0.11008401148244713,
"grad_norm": 0.10871689021587372,
"learning_rate": 0.002715164700232247,
"loss": 1.5652,
"step": 32720
},
{
"epoch": 0.11021569092201944,
"grad_norm": 0.09244067221879959,
"learning_rate": 0.002714793366568254,
"loss": 1.564,
"step": 32740
},
{
"epoch": 0.11034737036159174,
"grad_norm": 0.10256188362836838,
"learning_rate": 0.0027144218164392012,
"loss": 1.5575,
"step": 32760
},
{
"epoch": 0.11047904980116405,
"grad_norm": 0.10790042579174042,
"learning_rate": 0.0027140500499112956,
"loss": 1.5585,
"step": 32780
},
{
"epoch": 0.11061072924073635,
"grad_norm": 0.07326998561620712,
"learning_rate": 0.002713678067050782,
"loss": 1.5602,
"step": 32800
},
{
"epoch": 0.11074240868030866,
"grad_norm": 0.12128879874944687,
"learning_rate": 0.0027133058679239446,
"loss": 1.5558,
"step": 32820
},
{
"epoch": 0.11087408811988096,
"grad_norm": 0.0924782082438469,
"learning_rate": 0.0027129334525971068,
"loss": 1.5546,
"step": 32840
},
{
"epoch": 0.11100576755945327,
"grad_norm": 0.10736776888370514,
"learning_rate": 0.002712560821136628,
"loss": 1.5555,
"step": 32860
},
{
"epoch": 0.11113744699902557,
"grad_norm": 0.11395737528800964,
"learning_rate": 0.0027121879736089097,
"loss": 1.5535,
"step": 32880
},
{
"epoch": 0.11126912643859788,
"grad_norm": 0.08395570516586304,
"learning_rate": 0.0027118149100803877,
"loss": 1.5501,
"step": 32900
},
{
"epoch": 0.11140080587817018,
"grad_norm": 0.08537106215953827,
"learning_rate": 0.0027114416306175397,
"loss": 1.5457,
"step": 32920
},
{
"epoch": 0.11153248531774249,
"grad_norm": 0.06968770921230316,
"learning_rate": 0.002711068135286881,
"loss": 1.5526,
"step": 32940
},
{
"epoch": 0.11166416475731479,
"grad_norm": 0.10123132914304733,
"learning_rate": 0.0027106944241549647,
"loss": 1.5524,
"step": 32960
},
{
"epoch": 0.1117958441968871,
"grad_norm": 0.11128298938274384,
"learning_rate": 0.0027103204972883824,
"loss": 1.5412,
"step": 32980
},
{
"epoch": 0.1119275236364594,
"grad_norm": 0.08465181291103363,
"learning_rate": 0.002709946354753765,
"loss": 1.5507,
"step": 33000
},
{
"epoch": 0.1119275236364594,
"eval_loss": 1.6168590784072876,
"eval_runtime": 66.027,
"eval_samples_per_second": 15.145,
"eval_steps_per_second": 15.145,
"step": 33000
},
{
"epoch": 0.1120592030760317,
"grad_norm": 0.09486215561628342,
"learning_rate": 0.0027095719966177805,
"loss": 1.5482,
"step": 33020
},
{
"epoch": 0.11219088251560401,
"grad_norm": 0.09311071038246155,
"learning_rate": 0.0027091974229471365,
"loss": 1.5502,
"step": 33040
},
{
"epoch": 0.11232256195517631,
"grad_norm": 0.16168630123138428,
"learning_rate": 0.002708822633808579,
"loss": 1.5475,
"step": 33060
},
{
"epoch": 0.11245424139474862,
"grad_norm": 0.09388844668865204,
"learning_rate": 0.002708447629268891,
"loss": 1.5533,
"step": 33080
},
{
"epoch": 0.11258592083432092,
"grad_norm": 0.08351096510887146,
"learning_rate": 0.002708072409394896,
"loss": 1.5522,
"step": 33100
},
{
"epoch": 0.11271760027389323,
"grad_norm": 0.07432214170694351,
"learning_rate": 0.0027076969742534543,
"loss": 1.5471,
"step": 33120
},
{
"epoch": 0.11284927971346553,
"grad_norm": 0.09724659472703934,
"learning_rate": 0.002707321323911465,
"loss": 1.5502,
"step": 33140
},
{
"epoch": 0.11298095915303784,
"grad_norm": 0.08879043906927109,
"learning_rate": 0.0027069454584358658,
"loss": 1.5441,
"step": 33160
},
{
"epoch": 0.11311263859261014,
"grad_norm": 0.07506344467401505,
"learning_rate": 0.0027065693778936316,
"loss": 1.5691,
"step": 33180
},
{
"epoch": 0.11324431803218246,
"grad_norm": 0.10346978157758713,
"learning_rate": 0.0027061930823517777,
"loss": 1.5975,
"step": 33200
},
{
"epoch": 0.11337599747175477,
"grad_norm": 0.08535962551832199,
"learning_rate": 0.002705816571877355,
"loss": 1.6033,
"step": 33220
},
{
"epoch": 0.11350767691132707,
"grad_norm": 0.10019640624523163,
"learning_rate": 0.002705439846537456,
"loss": 1.6107,
"step": 33240
},
{
"epoch": 0.11363935635089938,
"grad_norm": 0.08656740933656693,
"learning_rate": 0.002705062906399209,
"loss": 1.6062,
"step": 33260
},
{
"epoch": 0.11377103579047168,
"grad_norm": 0.10879825055599213,
"learning_rate": 0.0027046857515297808,
"loss": 1.6123,
"step": 33280
},
{
"epoch": 0.11390271523004399,
"grad_norm": 0.11161535233259201,
"learning_rate": 0.002704308381996377,
"loss": 1.6132,
"step": 33300
},
{
"epoch": 0.11403439466961629,
"grad_norm": 0.07457931339740753,
"learning_rate": 0.002703930797866242,
"loss": 1.6062,
"step": 33320
},
{
"epoch": 0.1141660741091886,
"grad_norm": 0.08514375239610672,
"learning_rate": 0.002703552999206657,
"loss": 1.6045,
"step": 33340
},
{
"epoch": 0.1142977535487609,
"grad_norm": 0.07797901332378387,
"learning_rate": 0.0027031749860849438,
"loss": 1.6044,
"step": 33360
},
{
"epoch": 0.1144294329883332,
"grad_norm": 0.10032613575458527,
"learning_rate": 0.0027027967585684597,
"loss": 1.6016,
"step": 33380
},
{
"epoch": 0.11456111242790551,
"grad_norm": 0.07706362754106522,
"learning_rate": 0.0027024183167246012,
"loss": 1.5949,
"step": 33400
},
{
"epoch": 0.11469279186747781,
"grad_norm": 0.07698775827884674,
"learning_rate": 0.0027020396606208036,
"loss": 1.6026,
"step": 33420
},
{
"epoch": 0.11482447130705012,
"grad_norm": 0.09712442755699158,
"learning_rate": 0.00270166079032454,
"loss": 1.5968,
"step": 33440
},
{
"epoch": 0.11495615074662242,
"grad_norm": 0.0798928514122963,
"learning_rate": 0.002701281705903321,
"loss": 1.5939,
"step": 33460
},
{
"epoch": 0.11508783018619473,
"grad_norm": 0.09378674626350403,
"learning_rate": 0.002700902407424697,
"loss": 1.5946,
"step": 33480
},
{
"epoch": 0.11521950962576703,
"grad_norm": 0.1083533987402916,
"learning_rate": 0.0027005228949562544,
"loss": 1.5982,
"step": 33500
},
{
"epoch": 0.11535118906533934,
"grad_norm": 0.09362529218196869,
"learning_rate": 0.00270014316856562,
"loss": 1.5938,
"step": 33520
},
{
"epoch": 0.11548286850491164,
"grad_norm": 0.10311439633369446,
"learning_rate": 0.002699763228320457,
"loss": 1.5909,
"step": 33540
},
{
"epoch": 0.11561454794448395,
"grad_norm": 0.07770277559757233,
"learning_rate": 0.0026993830742884674,
"loss": 1.5921,
"step": 33560
},
{
"epoch": 0.11574622738405625,
"grad_norm": 0.08439300209283829,
"learning_rate": 0.002699002706537391,
"loss": 1.5847,
"step": 33580
},
{
"epoch": 0.11587790682362856,
"grad_norm": 0.09440808743238449,
"learning_rate": 0.0026986221251350056,
"loss": 1.5852,
"step": 33600
},
{
"epoch": 0.11600958626320086,
"grad_norm": 0.08001919090747833,
"learning_rate": 0.0026982413301491277,
"loss": 1.5938,
"step": 33620
},
{
"epoch": 0.11614126570277317,
"grad_norm": 0.11483153700828552,
"learning_rate": 0.002697860321647611,
"loss": 1.5927,
"step": 33640
},
{
"epoch": 0.11627294514234547,
"grad_norm": 0.10114043205976486,
"learning_rate": 0.0026974790996983486,
"loss": 1.5898,
"step": 33660
},
{
"epoch": 0.11640462458191778,
"grad_norm": 0.08223793655633926,
"learning_rate": 0.002697097664369271,
"loss": 1.5898,
"step": 33680
},
{
"epoch": 0.11653630402149008,
"grad_norm": 0.0857810378074646,
"learning_rate": 0.002696716015728345,
"loss": 1.5936,
"step": 33700
},
{
"epoch": 0.11666798346106239,
"grad_norm": 0.12150619924068451,
"learning_rate": 0.0026963341538435775,
"loss": 1.587,
"step": 33720
},
{
"epoch": 0.11679966290063469,
"grad_norm": 0.09355217963457108,
"learning_rate": 0.0026959520787830133,
"loss": 1.5856,
"step": 33740
},
{
"epoch": 0.116931342340207,
"grad_norm": 0.08837936073541641,
"learning_rate": 0.0026955697906147344,
"loss": 1.5895,
"step": 33760
},
{
"epoch": 0.1170630217797793,
"grad_norm": 0.08591131120920181,
"learning_rate": 0.002695187289406861,
"loss": 1.5967,
"step": 33780
},
{
"epoch": 0.1171947012193516,
"grad_norm": 0.11289795488119125,
"learning_rate": 0.002694804575227551,
"loss": 1.5971,
"step": 33800
},
{
"epoch": 0.11732638065892391,
"grad_norm": 0.09001953154802322,
"learning_rate": 0.002694421648145001,
"loss": 1.6129,
"step": 33820
},
{
"epoch": 0.11745806009849621,
"grad_norm": 0.10741370916366577,
"learning_rate": 0.002694038508227445,
"loss": 1.6142,
"step": 33840
},
{
"epoch": 0.11758973953806853,
"grad_norm": 0.08802719414234161,
"learning_rate": 0.0026936551555431553,
"loss": 1.6164,
"step": 33860
},
{
"epoch": 0.11772141897764084,
"grad_norm": 0.10249514877796173,
"learning_rate": 0.002693271590160441,
"loss": 1.6068,
"step": 33880
},
{
"epoch": 0.11785309841721314,
"grad_norm": 0.12778210639953613,
"learning_rate": 0.002692887812147651,
"loss": 1.604,
"step": 33900
},
{
"epoch": 0.11798477785678545,
"grad_norm": 0.10118341445922852,
"learning_rate": 0.0026925038215731703,
"loss": 1.6052,
"step": 33920
},
{
"epoch": 0.11811645729635775,
"grad_norm": 0.12567481398582458,
"learning_rate": 0.002692119618505423,
"loss": 1.6026,
"step": 33940
},
{
"epoch": 0.11824813673593006,
"grad_norm": 0.0919373631477356,
"learning_rate": 0.0026917352030128698,
"loss": 1.5962,
"step": 33960
},
{
"epoch": 0.11837981617550236,
"grad_norm": 0.10136484354734421,
"learning_rate": 0.002691350575164011,
"loss": 1.5898,
"step": 33980
},
{
"epoch": 0.11851149561507467,
"grad_norm": 0.07460084557533264,
"learning_rate": 0.0026909657350273827,
"loss": 1.5924,
"step": 34000
},
{
"epoch": 0.11851149561507467,
"eval_loss": 1.5006837844848633,
"eval_runtime": 66.9994,
"eval_samples_per_second": 14.926,
"eval_steps_per_second": 14.926,
"step": 34000
},
{
"epoch": 0.11864317505464697,
"grad_norm": 0.09306183457374573,
"learning_rate": 0.0026905806826715605,
"loss": 1.5871,
"step": 34020
},
{
"epoch": 0.11877485449421928,
"grad_norm": 0.08243928104639053,
"learning_rate": 0.002690195418165158,
"loss": 1.5946,
"step": 34040
},
{
"epoch": 0.11890653393379158,
"grad_norm": 0.08196361362934113,
"learning_rate": 0.002689809941576824,
"loss": 1.5878,
"step": 34060
},
{
"epoch": 0.11903821337336389,
"grad_norm": 0.09074049443006516,
"learning_rate": 0.0026894242529752485,
"loss": 1.5903,
"step": 34080
},
{
"epoch": 0.11916989281293619,
"grad_norm": 0.08904928714036942,
"learning_rate": 0.002689038352429157,
"loss": 1.5858,
"step": 34100
},
{
"epoch": 0.1193015722525085,
"grad_norm": 0.08144096285104752,
"learning_rate": 0.0026886522400073136,
"loss": 1.5845,
"step": 34120
},
{
"epoch": 0.1194332516920808,
"grad_norm": 0.1431560218334198,
"learning_rate": 0.00268826591577852,
"loss": 1.5868,
"step": 34140
},
{
"epoch": 0.1195649311316531,
"grad_norm": 0.09951731562614441,
"learning_rate": 0.002687879379811615,
"loss": 1.5827,
"step": 34160
},
{
"epoch": 0.11969661057122541,
"grad_norm": 0.12058053910732269,
"learning_rate": 0.0026874926321754766,
"loss": 1.5822,
"step": 34180
},
{
"epoch": 0.11982829001079771,
"grad_norm": 0.10634467750787735,
"learning_rate": 0.0026871056729390196,
"loss": 1.5869,
"step": 34200
},
{
"epoch": 0.11995996945037002,
"grad_norm": 0.09280095249414444,
"learning_rate": 0.002686718502171196,
"loss": 1.5891,
"step": 34220
},
{
"epoch": 0.12009164888994232,
"grad_norm": 0.11709116399288177,
"learning_rate": 0.002686331119940997,
"loss": 1.5816,
"step": 34240
},
{
"epoch": 0.12022332832951463,
"grad_norm": 0.07095829397439957,
"learning_rate": 0.00268594352631745,
"loss": 1.5885,
"step": 34260
},
{
"epoch": 0.12035500776908693,
"grad_norm": 0.0902029350399971,
"learning_rate": 0.00268555572136962,
"loss": 1.5819,
"step": 34280
},
{
"epoch": 0.12048668720865924,
"grad_norm": 0.08400021493434906,
"learning_rate": 0.0026851677051666113,
"loss": 1.5836,
"step": 34300
},
{
"epoch": 0.12061836664823154,
"grad_norm": 0.07917217165231705,
"learning_rate": 0.002684779477777565,
"loss": 1.5784,
"step": 34320
},
{
"epoch": 0.12075004608780385,
"grad_norm": 0.10317684710025787,
"learning_rate": 0.002684391039271659,
"loss": 1.5754,
"step": 34340
},
{
"epoch": 0.12088172552737615,
"grad_norm": 0.08167439699172974,
"learning_rate": 0.0026840023897181098,
"loss": 1.586,
"step": 34360
},
{
"epoch": 0.12101340496694846,
"grad_norm": 0.0829315185546875,
"learning_rate": 0.00268361352918617,
"loss": 1.6143,
"step": 34380
},
{
"epoch": 0.12114508440652076,
"grad_norm": 0.08923465013504028,
"learning_rate": 0.0026832244577451336,
"loss": 1.6303,
"step": 34400
},
{
"epoch": 0.12127676384609307,
"grad_norm": 0.0999564528465271,
"learning_rate": 0.002682835175464327,
"loss": 1.632,
"step": 34420
},
{
"epoch": 0.12140844328566537,
"grad_norm": 0.08035658299922943,
"learning_rate": 0.002682445682413118,
"loss": 1.6289,
"step": 34440
},
{
"epoch": 0.12154012272523768,
"grad_norm": 0.06893916428089142,
"learning_rate": 0.0026820559786609106,
"loss": 1.6304,
"step": 34460
},
{
"epoch": 0.12167180216480998,
"grad_norm": 0.10471726953983307,
"learning_rate": 0.0026816660642771466,
"loss": 1.6257,
"step": 34480
},
{
"epoch": 0.12180348160438229,
"grad_norm": 0.06977444887161255,
"learning_rate": 0.0026812759393313045,
"loss": 1.6235,
"step": 34500
},
{
"epoch": 0.12193516104395459,
"grad_norm": 0.0887407585978508,
"learning_rate": 0.0026808856038929014,
"loss": 1.6233,
"step": 34520
},
{
"epoch": 0.12206684048352691,
"grad_norm": 0.09635386615991592,
"learning_rate": 0.0026804950580314917,
"loss": 1.6219,
"step": 34540
},
{
"epoch": 0.12219851992309921,
"grad_norm": 0.0804891362786293,
"learning_rate": 0.0026801043018166667,
"loss": 1.619,
"step": 34560
},
{
"epoch": 0.12233019936267152,
"grad_norm": 0.08388678729534149,
"learning_rate": 0.0026797133353180557,
"loss": 1.6072,
"step": 34580
},
{
"epoch": 0.12246187880224382,
"grad_norm": 0.1082354336977005,
"learning_rate": 0.0026793221586053255,
"loss": 1.6141,
"step": 34600
},
{
"epoch": 0.12259355824181613,
"grad_norm": 0.08664815127849579,
"learning_rate": 0.0026789307717481805,
"loss": 1.6101,
"step": 34620
},
{
"epoch": 0.12272523768138843,
"grad_norm": 0.09746722877025604,
"learning_rate": 0.002678539174816361,
"loss": 1.6086,
"step": 34640
},
{
"epoch": 0.12285691712096074,
"grad_norm": 0.08757676929235458,
"learning_rate": 0.0026781473678796474,
"loss": 1.6021,
"step": 34660
},
{
"epoch": 0.12298859656053304,
"grad_norm": 0.10005202144384384,
"learning_rate": 0.0026777553510078556,
"loss": 1.6083,
"step": 34680
},
{
"epoch": 0.12312027600010535,
"grad_norm": 0.0922529324889183,
"learning_rate": 0.0026773631242708396,
"loss": 1.6052,
"step": 34700
},
{
"epoch": 0.12325195543967765,
"grad_norm": 0.0967714935541153,
"learning_rate": 0.00267697068773849,
"loss": 1.6057,
"step": 34720
},
{
"epoch": 0.12338363487924996,
"grad_norm": 0.07341698557138443,
"learning_rate": 0.002676578041480736,
"loss": 1.6049,
"step": 34740
},
{
"epoch": 0.12351531431882226,
"grad_norm": 0.09357757121324539,
"learning_rate": 0.0026761851855675433,
"loss": 1.6074,
"step": 34760
},
{
"epoch": 0.12364699375839457,
"grad_norm": 0.07980691641569138,
"learning_rate": 0.0026757921200689155,
"loss": 1.6043,
"step": 34780
},
{
"epoch": 0.12377867319796687,
"grad_norm": 0.1163335070014,
"learning_rate": 0.002675398845054893,
"loss": 1.6085,
"step": 34800
},
{
"epoch": 0.12391035263753918,
"grad_norm": 0.08081631362438202,
"learning_rate": 0.0026750053605955537,
"loss": 1.6018,
"step": 34820
},
{
"epoch": 0.12404203207711148,
"grad_norm": 0.0792580246925354,
"learning_rate": 0.002674611666761013,
"loss": 1.6092,
"step": 34840
},
{
"epoch": 0.12417371151668379,
"grad_norm": 0.0822744071483612,
"learning_rate": 0.002674217763621424,
"loss": 1.6052,
"step": 34860
},
{
"epoch": 0.12430539095625609,
"grad_norm": 0.10850385576486588,
"learning_rate": 0.002673823651246976,
"loss": 1.6001,
"step": 34880
},
{
"epoch": 0.1244370703958284,
"grad_norm": 0.10312029719352722,
"learning_rate": 0.002673429329707897,
"loss": 1.599,
"step": 34900
},
{
"epoch": 0.1245687498354007,
"grad_norm": 0.09553300589323044,
"learning_rate": 0.0026730347990744506,
"loss": 1.6001,
"step": 34920
},
{
"epoch": 0.124700429274973,
"grad_norm": 0.07871738821268082,
"learning_rate": 0.0026726400594169392,
"loss": 1.5985,
"step": 34940
},
{
"epoch": 0.12483210871454531,
"grad_norm": 0.1027330532670021,
"learning_rate": 0.0026722451108057016,
"loss": 1.5977,
"step": 34960
},
{
"epoch": 0.12496378815411761,
"grad_norm": 0.08380601555109024,
"learning_rate": 0.0026718499533111137,
"loss": 1.6039,
"step": 34980
},
{
"epoch": 0.12509546759368992,
"grad_norm": 0.09733425080776215,
"learning_rate": 0.002671454587003589,
"loss": 1.6059,
"step": 35000
},
{
"epoch": 0.12509546759368992,
"eval_loss": 1.5703957080841064,
"eval_runtime": 66.1504,
"eval_samples_per_second": 15.117,
"eval_steps_per_second": 15.117,
"step": 35000
},
{
"epoch": 0.12522714703326224,
"grad_norm": 0.08837222307920456,
"learning_rate": 0.0026710590119535787,
"loss": 1.5829,
"step": 35020
},
{
"epoch": 0.12535882647283453,
"grad_norm": 0.09444919973611832,
"learning_rate": 0.0026706632282315706,
"loss": 1.5766,
"step": 35040
},
{
"epoch": 0.12549050591240685,
"grad_norm": 0.09045890718698502,
"learning_rate": 0.0026702672359080887,
"loss": 1.5706,
"step": 35060
},
{
"epoch": 0.12562218535197914,
"grad_norm": 0.10616089403629303,
"learning_rate": 0.002669871035053697,
"loss": 1.5704,
"step": 35080
},
{
"epoch": 0.12575386479155146,
"grad_norm": 0.08494651317596436,
"learning_rate": 0.002669474625738993,
"loss": 1.5693,
"step": 35100
},
{
"epoch": 0.12588554423112375,
"grad_norm": 0.09198006242513657,
"learning_rate": 0.0026690780080346143,
"loss": 1.5588,
"step": 35120
},
{
"epoch": 0.12601722367069607,
"grad_norm": 0.07722193002700806,
"learning_rate": 0.0026686811820112346,
"loss": 1.5653,
"step": 35140
},
{
"epoch": 0.12614890311026836,
"grad_norm": 0.08537338674068451,
"learning_rate": 0.002668284147739564,
"loss": 1.5594,
"step": 35160
},
{
"epoch": 0.12628058254984068,
"grad_norm": 0.10831312835216522,
"learning_rate": 0.002667886905290351,
"loss": 1.5523,
"step": 35180
},
{
"epoch": 0.12641226198941297,
"grad_norm": 0.0943257287144661,
"learning_rate": 0.00266748945473438,
"loss": 1.553,
"step": 35200
},
{
"epoch": 0.12654394142898528,
"grad_norm": 0.1066376119852066,
"learning_rate": 0.0026670917961424735,
"loss": 1.5569,
"step": 35220
},
{
"epoch": 0.12667562086855758,
"grad_norm": 0.09195302426815033,
"learning_rate": 0.0026666939295854905,
"loss": 1.5524,
"step": 35240
},
{
"epoch": 0.1268073003081299,
"grad_norm": 0.09674491733312607,
"learning_rate": 0.002666295855134327,
"loss": 1.5522,
"step": 35260
},
{
"epoch": 0.12693897974770219,
"grad_norm": 0.12088479846715927,
"learning_rate": 0.0026658975728599166,
"loss": 1.5529,
"step": 35280
},
{
"epoch": 0.1270706591872745,
"grad_norm": 0.09849090874195099,
"learning_rate": 0.0026654990828332294,
"loss": 1.5502,
"step": 35300
},
{
"epoch": 0.1272023386268468,
"grad_norm": 0.08557942509651184,
"learning_rate": 0.0026651003851252725,
"loss": 1.5469,
"step": 35320
},
{
"epoch": 0.1273340180664191,
"grad_norm": 0.0989651307463646,
"learning_rate": 0.00266470147980709,
"loss": 1.5467,
"step": 35340
},
{
"epoch": 0.1274656975059914,
"grad_norm": 0.08966153860092163,
"learning_rate": 0.002664302366949764,
"loss": 1.5445,
"step": 35360
},
{
"epoch": 0.12759737694556372,
"grad_norm": 0.0903390496969223,
"learning_rate": 0.002663903046624412,
"loss": 1.5489,
"step": 35380
},
{
"epoch": 0.12772905638513601,
"grad_norm": 0.0847504660487175,
"learning_rate": 0.0026635035189021892,
"loss": 1.5421,
"step": 35400
},
{
"epoch": 0.12786073582470833,
"grad_norm": 0.11433856189250946,
"learning_rate": 0.0026631037838542883,
"loss": 1.5404,
"step": 35420
},
{
"epoch": 0.12799241526428062,
"grad_norm": 0.09573832899332047,
"learning_rate": 0.0026627038415519386,
"loss": 1.5505,
"step": 35440
},
{
"epoch": 0.12812409470385294,
"grad_norm": 0.10996285080909729,
"learning_rate": 0.002662303692066405,
"loss": 1.5422,
"step": 35460
},
{
"epoch": 0.12825577414342523,
"grad_norm": 0.13538189232349396,
"learning_rate": 0.0026619033354689917,
"loss": 1.5431,
"step": 35480
},
{
"epoch": 0.12838745358299755,
"grad_norm": 0.09150131791830063,
"learning_rate": 0.0026615027718310375,
"loss": 1.5489,
"step": 35500
},
{
"epoch": 0.12851913302256984,
"grad_norm": 0.08535768836736679,
"learning_rate": 0.00266110200122392,
"loss": 1.5474,
"step": 35520
},
{
"epoch": 0.12865081246214216,
"grad_norm": 0.0952446460723877,
"learning_rate": 0.002660701023719053,
"loss": 1.5451,
"step": 35540
},
{
"epoch": 0.12878249190171448,
"grad_norm": 0.1442309468984604,
"learning_rate": 0.0026602998393878865,
"loss": 1.5548,
"step": 35560
},
{
"epoch": 0.12891417134128677,
"grad_norm": 0.08960012346506119,
"learning_rate": 0.0026598984483019077,
"loss": 1.5595,
"step": 35580
},
{
"epoch": 0.1290458507808591,
"grad_norm": 0.09016614407300949,
"learning_rate": 0.002659496850532641,
"loss": 1.5564,
"step": 35600
},
{
"epoch": 0.12917753022043138,
"grad_norm": 0.11049813777208328,
"learning_rate": 0.0026590950461516482,
"loss": 1.5583,
"step": 35620
},
{
"epoch": 0.1293092096600037,
"grad_norm": 0.11803802847862244,
"learning_rate": 0.002658693035230526,
"loss": 1.5528,
"step": 35640
},
{
"epoch": 0.129440889099576,
"grad_norm": 0.12277698516845703,
"learning_rate": 0.00265829081784091,
"loss": 1.5452,
"step": 35660
},
{
"epoch": 0.1295725685391483,
"grad_norm": 0.08969718217849731,
"learning_rate": 0.002657888394054471,
"loss": 1.5436,
"step": 35680
},
{
"epoch": 0.1297042479787206,
"grad_norm": 0.07710202783346176,
"learning_rate": 0.002657485763942918,
"loss": 1.5429,
"step": 35700
},
{
"epoch": 0.12983592741829292,
"grad_norm": 0.10966431349515915,
"learning_rate": 0.0026570829275779947,
"loss": 1.5381,
"step": 35720
},
{
"epoch": 0.1299676068578652,
"grad_norm": 0.09629274159669876,
"learning_rate": 0.002656679885031484,
"loss": 1.5386,
"step": 35740
},
{
"epoch": 0.13009928629743753,
"grad_norm": 0.11513884365558624,
"learning_rate": 0.0026562766363752042,
"loss": 1.5343,
"step": 35760
},
{
"epoch": 0.13023096573700982,
"grad_norm": 0.10110338777303696,
"learning_rate": 0.0026558731816810105,
"loss": 1.5315,
"step": 35780
},
{
"epoch": 0.13036264517658214,
"grad_norm": 0.08176104724407196,
"learning_rate": 0.0026554695210207944,
"loss": 1.5365,
"step": 35800
},
{
"epoch": 0.13049432461615443,
"grad_norm": 0.09711804240942001,
"learning_rate": 0.0026550656544664848,
"loss": 1.5305,
"step": 35820
},
{
"epoch": 0.13062600405572675,
"grad_norm": 0.09326780587434769,
"learning_rate": 0.0026546615820900467,
"loss": 1.5236,
"step": 35840
},
{
"epoch": 0.13075768349529904,
"grad_norm": 0.10439273715019226,
"learning_rate": 0.002654257303963483,
"loss": 1.5217,
"step": 35860
},
{
"epoch": 0.13088936293487136,
"grad_norm": 0.09977664798498154,
"learning_rate": 0.002653852820158832,
"loss": 1.5241,
"step": 35880
},
{
"epoch": 0.13102104237444365,
"grad_norm": 0.08770251274108887,
"learning_rate": 0.0026534481307481685,
"loss": 1.5319,
"step": 35900
},
{
"epoch": 0.13115272181401597,
"grad_norm": 0.10881366580724716,
"learning_rate": 0.002653043235803605,
"loss": 1.5383,
"step": 35920
},
{
"epoch": 0.13128440125358826,
"grad_norm": 0.09104442596435547,
"learning_rate": 0.0026526381353972894,
"loss": 1.5326,
"step": 35940
},
{
"epoch": 0.13141608069316058,
"grad_norm": 0.12487766891717911,
"learning_rate": 0.0026522328296014076,
"loss": 1.5339,
"step": 35960
},
{
"epoch": 0.13154776013273287,
"grad_norm": 0.15558366477489471,
"learning_rate": 0.0026518273184881814,
"loss": 1.5229,
"step": 35980
},
{
"epoch": 0.13167943957230518,
"grad_norm": 0.1283443719148636,
"learning_rate": 0.0026514216021298687,
"loss": 1.5299,
"step": 36000
},
{
"epoch": 0.13167943957230518,
"eval_loss": 1.617323875427246,
"eval_runtime": 67.0387,
"eval_samples_per_second": 14.917,
"eval_steps_per_second": 14.917,
"step": 36000
},
{
"epoch": 0.13181111901187748,
"grad_norm": 0.14764146506786346,
"learning_rate": 0.0026510156805987645,
"loss": 1.5301,
"step": 36020
},
{
"epoch": 0.1319427984514498,
"grad_norm": 0.09800808131694794,
"learning_rate": 0.0026506095539672006,
"loss": 1.5251,
"step": 36040
},
{
"epoch": 0.13207447789102209,
"grad_norm": 0.09196116775274277,
"learning_rate": 0.0026502032223075446,
"loss": 1.5279,
"step": 36060
},
{
"epoch": 0.1322061573305944,
"grad_norm": 0.10031158477067947,
"learning_rate": 0.0026497966856922016,
"loss": 1.5282,
"step": 36080
},
{
"epoch": 0.1323378367701667,
"grad_norm": 0.12328962981700897,
"learning_rate": 0.0026493899441936124,
"loss": 1.5328,
"step": 36100
},
{
"epoch": 0.132469516209739,
"grad_norm": 0.1079377755522728,
"learning_rate": 0.0026489829978842546,
"loss": 1.5307,
"step": 36120
},
{
"epoch": 0.1326011956493113,
"grad_norm": 0.08541183918714523,
"learning_rate": 0.0026485758468366427,
"loss": 1.5356,
"step": 36140
},
{
"epoch": 0.13273287508888362,
"grad_norm": 0.10611236095428467,
"learning_rate": 0.0026481684911233267,
"loss": 1.5834,
"step": 36160
},
{
"epoch": 0.1328645545284559,
"grad_norm": 0.087572380900383,
"learning_rate": 0.0026477609308168944,
"loss": 1.6016,
"step": 36180
},
{
"epoch": 0.13299623396802823,
"grad_norm": 0.1034546047449112,
"learning_rate": 0.002647353165989968,
"loss": 1.6119,
"step": 36200
},
{
"epoch": 0.13312791340760055,
"grad_norm": 0.09647917747497559,
"learning_rate": 0.002646945196715209,
"loss": 1.6142,
"step": 36220
},
{
"epoch": 0.13325959284717284,
"grad_norm": 0.08855011314153671,
"learning_rate": 0.002646537023065313,
"loss": 1.6148,
"step": 36240
},
{
"epoch": 0.13339127228674516,
"grad_norm": 0.10243046283721924,
"learning_rate": 0.0026461286451130127,
"loss": 1.6155,
"step": 36260
},
{
"epoch": 0.13352295172631745,
"grad_norm": 0.105488620698452,
"learning_rate": 0.0026457200629310777,
"loss": 1.614,
"step": 36280
},
{
"epoch": 0.13365463116588977,
"grad_norm": 0.08305686712265015,
"learning_rate": 0.0026453112765923133,
"loss": 1.6059,
"step": 36300
},
{
"epoch": 0.13378631060546206,
"grad_norm": 0.09603402763605118,
"learning_rate": 0.0026449022861695618,
"loss": 1.6018,
"step": 36320
},
{
"epoch": 0.13391799004503438,
"grad_norm": 0.11666828393936157,
"learning_rate": 0.0026444930917357014,
"loss": 1.6017,
"step": 36340
},
{
"epoch": 0.13404966948460667,
"grad_norm": 0.1235344409942627,
"learning_rate": 0.0026440836933636466,
"loss": 1.5965,
"step": 36360
},
{
"epoch": 0.134181348924179,
"grad_norm": 0.11957265436649323,
"learning_rate": 0.002643674091126349,
"loss": 1.5957,
"step": 36380
},
{
"epoch": 0.13431302836375128,
"grad_norm": 0.11756687611341476,
"learning_rate": 0.0026432642850967953,
"loss": 1.5999,
"step": 36400
},
{
"epoch": 0.1344447078033236,
"grad_norm": 0.10342928767204285,
"learning_rate": 0.002642854275348009,
"loss": 1.592,
"step": 36420
},
{
"epoch": 0.1345763872428959,
"grad_norm": 0.10075769573450089,
"learning_rate": 0.002642444061953051,
"loss": 1.5932,
"step": 36440
},
{
"epoch": 0.1347080666824682,
"grad_norm": 0.10493767261505127,
"learning_rate": 0.002642033644985017,
"loss": 1.5928,
"step": 36460
},
{
"epoch": 0.1348397461220405,
"grad_norm": 0.1051807627081871,
"learning_rate": 0.00264162302451704,
"loss": 1.5842,
"step": 36480
},
{
"epoch": 0.13497142556161282,
"grad_norm": 0.10073640197515488,
"learning_rate": 0.0026412122006222883,
"loss": 1.5831,
"step": 36500
},
{
"epoch": 0.1351031050011851,
"grad_norm": 0.10793869942426682,
"learning_rate": 0.0026408011733739674,
"loss": 1.5888,
"step": 36520
},
{
"epoch": 0.13523478444075743,
"grad_norm": 0.08608701080083847,
"learning_rate": 0.002640389942845318,
"loss": 1.588,
"step": 36540
},
{
"epoch": 0.13536646388032972,
"grad_norm": 0.08790282160043716,
"learning_rate": 0.0026399785091096176,
"loss": 1.5869,
"step": 36560
},
{
"epoch": 0.13549814331990204,
"grad_norm": 0.08713233470916748,
"learning_rate": 0.002639566872240181,
"loss": 1.5829,
"step": 36580
},
{
"epoch": 0.13562982275947433,
"grad_norm": 0.08939250558614731,
"learning_rate": 0.0026391550323103573,
"loss": 1.582,
"step": 36600
},
{
"epoch": 0.13576150219904665,
"grad_norm": 0.09528082609176636,
"learning_rate": 0.0026387429893935327,
"loss": 1.5845,
"step": 36620
},
{
"epoch": 0.13589318163861894,
"grad_norm": 0.12500585615634918,
"learning_rate": 0.0026383307435631294,
"loss": 1.5823,
"step": 36640
},
{
"epoch": 0.13602486107819126,
"grad_norm": 0.0984441414475441,
"learning_rate": 0.0026379182948926055,
"loss": 1.5762,
"step": 36660
},
{
"epoch": 0.13615654051776355,
"grad_norm": 0.11194117367267609,
"learning_rate": 0.0026375056434554565,
"loss": 1.5809,
"step": 36680
},
{
"epoch": 0.13628821995733587,
"grad_norm": 0.11597609519958496,
"learning_rate": 0.002637092789325212,
"loss": 1.5774,
"step": 36700
},
{
"epoch": 0.13641989939690816,
"grad_norm": 0.07991953939199448,
"learning_rate": 0.0026366797325754403,
"loss": 1.581,
"step": 36720
},
{
"epoch": 0.13655157883648048,
"grad_norm": 0.10064183175563812,
"learning_rate": 0.0026362664732797426,
"loss": 1.5853,
"step": 36740
},
{
"epoch": 0.13668325827605277,
"grad_norm": 0.1042194738984108,
"learning_rate": 0.0026358530115117595,
"loss": 1.5975,
"step": 36760
},
{
"epoch": 0.13681493771562508,
"grad_norm": 0.10666348040103912,
"learning_rate": 0.002635439347345165,
"loss": 1.6029,
"step": 36780
},
{
"epoch": 0.13694661715519738,
"grad_norm": 0.1007642075419426,
"learning_rate": 0.0026350254808536707,
"loss": 1.6028,
"step": 36800
},
{
"epoch": 0.1370782965947697,
"grad_norm": 0.08334644138813019,
"learning_rate": 0.002634611412111024,
"loss": 1.6097,
"step": 36820
},
{
"epoch": 0.13720997603434198,
"grad_norm": 0.09047345817089081,
"learning_rate": 0.0026341971411910077,
"loss": 1.6055,
"step": 36840
},
{
"epoch": 0.1373416554739143,
"grad_norm": 0.16159166395664215,
"learning_rate": 0.002633782668167442,
"loss": 1.5987,
"step": 36860
},
{
"epoch": 0.1374733349134866,
"grad_norm": 0.10918816179037094,
"learning_rate": 0.002633367993114181,
"loss": 1.604,
"step": 36880
},
{
"epoch": 0.1376050143530589,
"grad_norm": 0.10157617926597595,
"learning_rate": 0.002632953116105116,
"loss": 1.5927,
"step": 36900
},
{
"epoch": 0.13773669379263123,
"grad_norm": 0.09241142123937607,
"learning_rate": 0.0026325380372141756,
"loss": 1.5981,
"step": 36920
},
{
"epoch": 0.13786837323220352,
"grad_norm": 0.12108739465475082,
"learning_rate": 0.002632122756515322,
"loss": 1.592,
"step": 36940
},
{
"epoch": 0.13800005267177584,
"grad_norm": 0.09442280977964401,
"learning_rate": 0.0026317072740825545,
"loss": 1.5884,
"step": 36960
},
{
"epoch": 0.13813173211134813,
"grad_norm": 0.09058595448732376,
"learning_rate": 0.0026312915899899085,
"loss": 1.5859,
"step": 36980
},
{
"epoch": 0.13826341155092045,
"grad_norm": 0.08916100859642029,
"learning_rate": 0.002630875704311455,
"loss": 1.5841,
"step": 37000
},
{
"epoch": 0.13826341155092045,
"eval_loss": 1.493425726890564,
"eval_runtime": 67.4059,
"eval_samples_per_second": 14.836,
"eval_steps_per_second": 14.836,
"step": 37000
},
{
"epoch": 0.13839509099049274,
"grad_norm": 0.08742368966341019,
"learning_rate": 0.0026304596171213015,
"loss": 1.588,
"step": 37020
},
{
"epoch": 0.13852677043006506,
"grad_norm": 0.07880369573831558,
"learning_rate": 0.0026300433284935907,
"loss": 1.5861,
"step": 37040
},
{
"epoch": 0.13865844986963735,
"grad_norm": 0.08849447965621948,
"learning_rate": 0.0026296268385025004,
"loss": 1.5832,
"step": 37060
},
{
"epoch": 0.13879012930920967,
"grad_norm": 0.08267071843147278,
"learning_rate": 0.002629210147222247,
"loss": 1.585,
"step": 37080
},
{
"epoch": 0.13892180874878196,
"grad_norm": 0.08915061503648758,
"learning_rate": 0.0026287932547270796,
"loss": 1.5886,
"step": 37100
},
{
"epoch": 0.13905348818835428,
"grad_norm": 0.11180838197469711,
"learning_rate": 0.0026283761610912853,
"loss": 1.5786,
"step": 37120
},
{
"epoch": 0.13918516762792657,
"grad_norm": 0.14976435899734497,
"learning_rate": 0.002627958866389186,
"loss": 1.5809,
"step": 37140
},
{
"epoch": 0.1393168470674989,
"grad_norm": 0.09413915127515793,
"learning_rate": 0.002627541370695141,
"loss": 1.5791,
"step": 37160
},
{
"epoch": 0.13944852650707118,
"grad_norm": 0.10926341265439987,
"learning_rate": 0.0026271236740835428,
"loss": 1.5841,
"step": 37180
},
{
"epoch": 0.1395802059466435,
"grad_norm": 0.09298263490200043,
"learning_rate": 0.002626705776628822,
"loss": 1.587,
"step": 37200
},
{
"epoch": 0.1397118853862158,
"grad_norm": 0.1033315360546112,
"learning_rate": 0.002626287678405443,
"loss": 1.5787,
"step": 37220
},
{
"epoch": 0.1398435648257881,
"grad_norm": 0.10745333135128021,
"learning_rate": 0.002625869379487908,
"loss": 1.5761,
"step": 37240
},
{
"epoch": 0.1399752442653604,
"grad_norm": 0.11225748062133789,
"learning_rate": 0.0026254508799507543,
"loss": 1.5859,
"step": 37260
},
{
"epoch": 0.14010692370493272,
"grad_norm": 0.09762544184923172,
"learning_rate": 0.002625032179868554,
"loss": 1.5775,
"step": 37280
},
{
"epoch": 0.140238603144505,
"grad_norm": 0.0946531891822815,
"learning_rate": 0.002624613279315916,
"loss": 1.5794,
"step": 37300
},
{
"epoch": 0.14037028258407733,
"grad_norm": 0.07943738996982574,
"learning_rate": 0.0026241941783674842,
"loss": 1.5804,
"step": 37320
},
{
"epoch": 0.14050196202364962,
"grad_norm": 0.09314402937889099,
"learning_rate": 0.0026237748770979387,
"loss": 1.5749,
"step": 37340
},
{
"epoch": 0.14063364146322194,
"grad_norm": 0.104873888194561,
"learning_rate": 0.0026233553755819956,
"loss": 1.5279,
"step": 37360
},
{
"epoch": 0.14076532090279423,
"grad_norm": 0.09734835475683212,
"learning_rate": 0.0026229356738944054,
"loss": 1.4679,
"step": 37380
},
{
"epoch": 0.14089700034236655,
"grad_norm": 0.10877981036901474,
"learning_rate": 0.0026225157721099556,
"loss": 1.4734,
"step": 37400
},
{
"epoch": 0.14102867978193884,
"grad_norm": 0.10789605230093002,
"learning_rate": 0.002622095670303469,
"loss": 1.4646,
"step": 37420
},
{
"epoch": 0.14116035922151116,
"grad_norm": 0.08844413608312607,
"learning_rate": 0.0026216753685498035,
"loss": 1.4594,
"step": 37440
},
{
"epoch": 0.14129203866108345,
"grad_norm": 0.07974802702665329,
"learning_rate": 0.0026212548669238534,
"loss": 1.4563,
"step": 37460
},
{
"epoch": 0.14142371810065577,
"grad_norm": 0.1050298884510994,
"learning_rate": 0.002620834165500548,
"loss": 1.4593,
"step": 37480
},
{
"epoch": 0.14155539754022806,
"grad_norm": 0.11050856858491898,
"learning_rate": 0.0026204132643548525,
"loss": 1.4532,
"step": 37500
},
{
"epoch": 0.14168707697980037,
"grad_norm": 0.09087752550840378,
"learning_rate": 0.0026199921635617672,
"loss": 1.4568,
"step": 37520
},
{
"epoch": 0.14181875641937267,
"grad_norm": 0.08688180893659592,
"learning_rate": 0.0026195708631963294,
"loss": 1.4584,
"step": 37540
},
{
"epoch": 0.14195043585894498,
"grad_norm": 0.08796868473291397,
"learning_rate": 0.00261914936333361,
"loss": 1.4513,
"step": 37560
},
{
"epoch": 0.1420821152985173,
"grad_norm": 0.1213894784450531,
"learning_rate": 0.002618727664048717,
"loss": 1.4539,
"step": 37580
},
{
"epoch": 0.1422137947380896,
"grad_norm": 0.11895439028739929,
"learning_rate": 0.0026183057654167933,
"loss": 1.4568,
"step": 37600
},
{
"epoch": 0.1423454741776619,
"grad_norm": 0.10927541553974152,
"learning_rate": 0.002617883667513017,
"loss": 1.4576,
"step": 37620
},
{
"epoch": 0.1424771536172342,
"grad_norm": 0.11971597373485565,
"learning_rate": 0.0026174613704126027,
"loss": 1.4586,
"step": 37640
},
{
"epoch": 0.14260883305680652,
"grad_norm": 0.11147040128707886,
"learning_rate": 0.0026170388741907995,
"loss": 1.4556,
"step": 37660
},
{
"epoch": 0.1427405124963788,
"grad_norm": 0.09948437660932541,
"learning_rate": 0.0026166161789228917,
"loss": 1.4559,
"step": 37680
},
{
"epoch": 0.14287219193595113,
"grad_norm": 0.11996204406023026,
"learning_rate": 0.0026161932846842013,
"loss": 1.458,
"step": 37700
},
{
"epoch": 0.14300387137552342,
"grad_norm": 0.1091773509979248,
"learning_rate": 0.0026157701915500826,
"loss": 1.4576,
"step": 37720
},
{
"epoch": 0.14313555081509574,
"grad_norm": 0.27840930223464966,
"learning_rate": 0.002615346899595928,
"loss": 1.464,
"step": 37740
},
{
"epoch": 0.14326723025466803,
"grad_norm": 0.09474640339612961,
"learning_rate": 0.002614923408897164,
"loss": 1.4745,
"step": 37760
},
{
"epoch": 0.14339890969424035,
"grad_norm": 0.13245952129364014,
"learning_rate": 0.002614499719529252,
"loss": 1.4685,
"step": 37780
},
{
"epoch": 0.14353058913381264,
"grad_norm": 0.10501421242952347,
"learning_rate": 0.0026140758315676906,
"loss": 1.4674,
"step": 37800
},
{
"epoch": 0.14366226857338496,
"grad_norm": 0.10588248074054718,
"learning_rate": 0.0026136517450880124,
"loss": 1.4648,
"step": 37820
},
{
"epoch": 0.14379394801295725,
"grad_norm": 0.10599175095558167,
"learning_rate": 0.0026132274601657853,
"loss": 1.4685,
"step": 37840
},
{
"epoch": 0.14392562745252957,
"grad_norm": 0.11727793514728546,
"learning_rate": 0.002612802976876614,
"loss": 1.4643,
"step": 37860
},
{
"epoch": 0.14405730689210186,
"grad_norm": 0.09941857308149338,
"learning_rate": 0.0026123782952961363,
"loss": 1.4645,
"step": 37880
},
{
"epoch": 0.14418898633167418,
"grad_norm": 0.09774893522262573,
"learning_rate": 0.0026119534155000274,
"loss": 1.4684,
"step": 37900
},
{
"epoch": 0.14432066577124647,
"grad_norm": 0.10435054451227188,
"learning_rate": 0.002611528337563997,
"loss": 1.4912,
"step": 37920
},
{
"epoch": 0.1444523452108188,
"grad_norm": 0.1452368199825287,
"learning_rate": 0.0026111030615637893,
"loss": 1.5458,
"step": 37940
},
{
"epoch": 0.14458402465039108,
"grad_norm": 0.1285165399312973,
"learning_rate": 0.0026106775875751856,
"loss": 1.5752,
"step": 37960
},
{
"epoch": 0.1447157040899634,
"grad_norm": 0.11321987956762314,
"learning_rate": 0.0026102519156740007,
"loss": 1.5846,
"step": 37980
},
{
"epoch": 0.1448473835295357,
"grad_norm": 0.0958334282040596,
"learning_rate": 0.0026098260459360865,
"loss": 1.5965,
"step": 38000
},
{
"epoch": 0.1448473835295357,
"eval_loss": 1.5834728479385376,
"eval_runtime": 67.4429,
"eval_samples_per_second": 14.827,
"eval_steps_per_second": 14.827,
"step": 38000
},
{
"epoch": 0.144979062969108,
"grad_norm": 0.12879179418087006,
"learning_rate": 0.0026093999784373273,
"loss": 1.595,
"step": 38020
},
{
"epoch": 0.1451107424086803,
"grad_norm": 0.10820400714874268,
"learning_rate": 0.0026089737132536464,
"loss": 1.5911,
"step": 38040
},
{
"epoch": 0.14524242184825262,
"grad_norm": 0.09675215184688568,
"learning_rate": 0.002608547250460999,
"loss": 1.589,
"step": 38060
},
{
"epoch": 0.1453741012878249,
"grad_norm": 0.11472152918577194,
"learning_rate": 0.0026081205901353774,
"loss": 1.5921,
"step": 38080
},
{
"epoch": 0.14550578072739723,
"grad_norm": 0.12123990058898926,
"learning_rate": 0.0026076937323528085,
"loss": 1.5846,
"step": 38100
},
{
"epoch": 0.14563746016696952,
"grad_norm": 0.11360788345336914,
"learning_rate": 0.0026072666771893545,
"loss": 1.586,
"step": 38120
},
{
"epoch": 0.14576913960654184,
"grad_norm": 0.10187938064336777,
"learning_rate": 0.0026068394247211126,
"loss": 1.5779,
"step": 38140
},
{
"epoch": 0.14590081904611413,
"grad_norm": 0.1109524741768837,
"learning_rate": 0.002606411975024215,
"loss": 1.582,
"step": 38160
},
{
"epoch": 0.14603249848568645,
"grad_norm": 0.13011963665485382,
"learning_rate": 0.0026059843281748298,
"loss": 1.5822,
"step": 38180
},
{
"epoch": 0.14616417792525874,
"grad_norm": 0.14091023802757263,
"learning_rate": 0.0026055564842491596,
"loss": 1.5789,
"step": 38200
},
{
"epoch": 0.14629585736483106,
"grad_norm": 0.11127016693353653,
"learning_rate": 0.002605128443323442,
"loss": 1.5769,
"step": 38220
},
{
"epoch": 0.14642753680440337,
"grad_norm": 0.11978462338447571,
"learning_rate": 0.002604700205473951,
"loss": 1.5744,
"step": 38240
},
{
"epoch": 0.14655921624397567,
"grad_norm": 0.09419921040534973,
"learning_rate": 0.002604271770776993,
"loss": 1.5677,
"step": 38260
},
{
"epoch": 0.14669089568354798,
"grad_norm": 0.10313443094491959,
"learning_rate": 0.0026038431393089127,
"loss": 1.5681,
"step": 38280
},
{
"epoch": 0.14682257512312027,
"grad_norm": 0.12435714900493622,
"learning_rate": 0.0026034143111460877,
"loss": 1.5635,
"step": 38300
},
{
"epoch": 0.1469542545626926,
"grad_norm": 0.09440986067056656,
"learning_rate": 0.002602985286364931,
"loss": 1.5695,
"step": 38320
},
{
"epoch": 0.14708593400226488,
"grad_norm": 0.12459173798561096,
"learning_rate": 0.0026025560650418914,
"loss": 1.5649,
"step": 38340
},
{
"epoch": 0.1472176134418372,
"grad_norm": 0.1102808341383934,
"learning_rate": 0.0026021266472534515,
"loss": 1.5629,
"step": 38360
},
{
"epoch": 0.1473492928814095,
"grad_norm": 0.10280980169773102,
"learning_rate": 0.00260169703307613,
"loss": 1.5676,
"step": 38380
},
{
"epoch": 0.1474809723209818,
"grad_norm": 0.1017128974199295,
"learning_rate": 0.0026012672225864805,
"loss": 1.5665,
"step": 38400
},
{
"epoch": 0.1476126517605541,
"grad_norm": 0.11201263964176178,
"learning_rate": 0.002600837215861091,
"loss": 1.5607,
"step": 38420
},
{
"epoch": 0.14774433120012642,
"grad_norm": 0.09382157772779465,
"learning_rate": 0.0026004070129765845,
"loss": 1.5699,
"step": 38440
},
{
"epoch": 0.1478760106396987,
"grad_norm": 0.09265664219856262,
"learning_rate": 0.00259997661400962,
"loss": 1.5608,
"step": 38460
},
{
"epoch": 0.14800769007927103,
"grad_norm": 0.13978609442710876,
"learning_rate": 0.00259954601903689,
"loss": 1.5632,
"step": 38480
},
{
"epoch": 0.14813936951884332,
"grad_norm": 0.09976094961166382,
"learning_rate": 0.0025991152281351223,
"loss": 1.5662,
"step": 38500
},
{
"epoch": 0.14827104895841564,
"grad_norm": 0.13578425347805023,
"learning_rate": 0.002598684241381081,
"loss": 1.5691,
"step": 38520
},
{
"epoch": 0.14840272839798793,
"grad_norm": 0.09976605325937271,
"learning_rate": 0.002598253058851563,
"loss": 1.5962,
"step": 38540
},
{
"epoch": 0.14853440783756025,
"grad_norm": 0.10971450805664062,
"learning_rate": 0.0025978216806234015,
"loss": 1.592,
"step": 38560
},
{
"epoch": 0.14866608727713254,
"grad_norm": 0.11708176881074905,
"learning_rate": 0.0025973901067734644,
"loss": 1.5908,
"step": 38580
},
{
"epoch": 0.14879776671670486,
"grad_norm": 0.08862312138080597,
"learning_rate": 0.0025969583373786536,
"loss": 1.5871,
"step": 38600
},
{
"epoch": 0.14892944615627715,
"grad_norm": 0.12013594061136246,
"learning_rate": 0.0025965263725159066,
"loss": 1.5808,
"step": 38620
},
{
"epoch": 0.14906112559584947,
"grad_norm": 0.093787781894207,
"learning_rate": 0.0025960942122621963,
"loss": 1.5854,
"step": 38640
},
{
"epoch": 0.14919280503542176,
"grad_norm": 0.08362217992544174,
"learning_rate": 0.0025956618566945287,
"loss": 1.5826,
"step": 38660
},
{
"epoch": 0.14932448447499408,
"grad_norm": 0.1498386114835739,
"learning_rate": 0.002595229305889946,
"loss": 1.5732,
"step": 38680
},
{
"epoch": 0.14945616391456637,
"grad_norm": 0.09603530913591385,
"learning_rate": 0.0025947965599255247,
"loss": 1.5698,
"step": 38700
},
{
"epoch": 0.1495878433541387,
"grad_norm": 0.0774497240781784,
"learning_rate": 0.0025943636188783766,
"loss": 1.5715,
"step": 38720
},
{
"epoch": 0.14971952279371098,
"grad_norm": 0.08751595765352249,
"learning_rate": 0.002593930482825647,
"loss": 1.576,
"step": 38740
},
{
"epoch": 0.1498512022332833,
"grad_norm": 0.0924377366900444,
"learning_rate": 0.002593497151844518,
"loss": 1.5715,
"step": 38760
},
{
"epoch": 0.1499828816728556,
"grad_norm": 0.10947736352682114,
"learning_rate": 0.0025930636260122044,
"loss": 1.5582,
"step": 38780
},
{
"epoch": 0.1501145611124279,
"grad_norm": 0.09718424081802368,
"learning_rate": 0.0025926299054059567,
"loss": 1.5644,
"step": 38800
},
{
"epoch": 0.1502462405520002,
"grad_norm": 0.1110563725233078,
"learning_rate": 0.0025921959901030597,
"loss": 1.5656,
"step": 38820
},
{
"epoch": 0.15037791999157252,
"grad_norm": 0.09171340614557266,
"learning_rate": 0.0025917618801808333,
"loss": 1.5597,
"step": 38840
},
{
"epoch": 0.1505095994311448,
"grad_norm": 0.12216000258922577,
"learning_rate": 0.0025913275757166324,
"loss": 1.5548,
"step": 38860
},
{
"epoch": 0.15064127887071713,
"grad_norm": 0.08841335028409958,
"learning_rate": 0.002590893076787845,
"loss": 1.5601,
"step": 38880
},
{
"epoch": 0.15077295831028942,
"grad_norm": 0.10563861578702927,
"learning_rate": 0.002590458383471896,
"loss": 1.5535,
"step": 38900
},
{
"epoch": 0.15090463774986174,
"grad_norm": 0.08755604177713394,
"learning_rate": 0.0025900234958462433,
"loss": 1.5501,
"step": 38920
},
{
"epoch": 0.15103631718943406,
"grad_norm": 0.13694095611572266,
"learning_rate": 0.0025895884139883795,
"loss": 1.5627,
"step": 38940
},
{
"epoch": 0.15116799662900635,
"grad_norm": 0.10837943106889725,
"learning_rate": 0.002589153137975833,
"loss": 1.5613,
"step": 38960
},
{
"epoch": 0.15129967606857866,
"grad_norm": 0.08162432163953781,
"learning_rate": 0.0025887176678861647,
"loss": 1.5607,
"step": 38980
},
{
"epoch": 0.15143135550815096,
"grad_norm": 0.14715518057346344,
"learning_rate": 0.002588282003796973,
"loss": 1.5544,
"step": 39000
},
{
"epoch": 0.15143135550815096,
"eval_loss": 1.427059292793274,
"eval_runtime": 66.7992,
"eval_samples_per_second": 14.97,
"eval_steps_per_second": 14.97,
"step": 39000
},
{
"epoch": 0.15156303494772327,
"grad_norm": 0.10396742075681686,
"learning_rate": 0.002587846145785888,
"loss": 1.5584,
"step": 39020
},
{
"epoch": 0.15169471438729557,
"grad_norm": 0.12578904628753662,
"learning_rate": 0.002587410093930576,
"loss": 1.5543,
"step": 39040
},
{
"epoch": 0.15182639382686788,
"grad_norm": 0.12245041877031326,
"learning_rate": 0.0025869738483087386,
"loss": 1.5484,
"step": 39060
},
{
"epoch": 0.15195807326644017,
"grad_norm": 0.10764380544424057,
"learning_rate": 0.0025865374089981087,
"loss": 1.5526,
"step": 39080
},
{
"epoch": 0.1520897527060125,
"grad_norm": 0.10245970636606216,
"learning_rate": 0.002586100776076457,
"loss": 1.5609,
"step": 39100
},
{
"epoch": 0.15222143214558478,
"grad_norm": 0.11582383513450623,
"learning_rate": 0.0025856639496215873,
"loss": 1.5789,
"step": 39120
},
{
"epoch": 0.1523531115851571,
"grad_norm": 0.09922783076763153,
"learning_rate": 0.0025852269297113382,
"loss": 1.6029,
"step": 39140
},
{
"epoch": 0.1524847910247294,
"grad_norm": 0.08174051344394684,
"learning_rate": 0.002584789716423583,
"loss": 1.5928,
"step": 39160
},
{
"epoch": 0.1526164704643017,
"grad_norm": 0.14259853959083557,
"learning_rate": 0.0025843523098362277,
"loss": 1.6008,
"step": 39180
},
{
"epoch": 0.152748149903874,
"grad_norm": 0.10020045936107635,
"learning_rate": 0.0025839147100272155,
"loss": 1.6035,
"step": 39200
},
{
"epoch": 0.15287982934344632,
"grad_norm": 0.1230427622795105,
"learning_rate": 0.002583476917074522,
"loss": 1.6032,
"step": 39220
},
{
"epoch": 0.1530115087830186,
"grad_norm": 0.0876646339893341,
"learning_rate": 0.002583038931056159,
"loss": 1.5921,
"step": 39240
},
{
"epoch": 0.15314318822259093,
"grad_norm": 0.14442962408065796,
"learning_rate": 0.0025826007520501704,
"loss": 1.5894,
"step": 39260
},
{
"epoch": 0.15327486766216322,
"grad_norm": 0.130369171500206,
"learning_rate": 0.0025821623801346354,
"loss": 1.5833,
"step": 39280
},
{
"epoch": 0.15340654710173554,
"grad_norm": 0.09191744774580002,
"learning_rate": 0.002581723815387669,
"loss": 1.5819,
"step": 39300
},
{
"epoch": 0.15353822654130783,
"grad_norm": 0.12108132243156433,
"learning_rate": 0.002581285057887419,
"loss": 1.5859,
"step": 39320
},
{
"epoch": 0.15366990598088015,
"grad_norm": 0.09722419083118439,
"learning_rate": 0.002580846107712068,
"loss": 1.5811,
"step": 39340
},
{
"epoch": 0.15380158542045244,
"grad_norm": 0.0996871218085289,
"learning_rate": 0.0025804069649398324,
"loss": 1.5806,
"step": 39360
},
{
"epoch": 0.15393326486002476,
"grad_norm": 0.1356852501630783,
"learning_rate": 0.002579967629648964,
"loss": 1.5764,
"step": 39380
},
{
"epoch": 0.15406494429959705,
"grad_norm": 0.0935957059264183,
"learning_rate": 0.0025795281019177483,
"loss": 1.5694,
"step": 39400
},
{
"epoch": 0.15419662373916937,
"grad_norm": 0.10903099179267883,
"learning_rate": 0.002579088381824505,
"loss": 1.5665,
"step": 39420
},
{
"epoch": 0.15432830317874166,
"grad_norm": 0.10038184374570847,
"learning_rate": 0.0025786484694475882,
"loss": 1.5714,
"step": 39440
},
{
"epoch": 0.15445998261831398,
"grad_norm": 0.08461392670869827,
"learning_rate": 0.002578208364865386,
"loss": 1.5699,
"step": 39460
},
{
"epoch": 0.15459166205788627,
"grad_norm": 0.09134264290332794,
"learning_rate": 0.0025777680681563215,
"loss": 1.5695,
"step": 39480
},
{
"epoch": 0.1547233414974586,
"grad_norm": 0.11467129737138748,
"learning_rate": 0.002577327579398851,
"loss": 1.5743,
"step": 39500
},
{
"epoch": 0.15485502093703088,
"grad_norm": 0.09146096557378769,
"learning_rate": 0.002576886898671466,
"loss": 1.5711,
"step": 39520
},
{
"epoch": 0.1549867003766032,
"grad_norm": 0.08838360756635666,
"learning_rate": 0.0025764460260526917,
"loss": 1.5699,
"step": 39540
},
{
"epoch": 0.1551183798161755,
"grad_norm": 0.09347314387559891,
"learning_rate": 0.0025760049616210872,
"loss": 1.568,
"step": 39560
},
{
"epoch": 0.1552500592557478,
"grad_norm": 0.11676613986492157,
"learning_rate": 0.002575563705455247,
"loss": 1.5667,
"step": 39580
},
{
"epoch": 0.15538173869532013,
"grad_norm": 0.11522109806537628,
"learning_rate": 0.002575122257633798,
"loss": 1.5708,
"step": 39600
},
{
"epoch": 0.15551341813489242,
"grad_norm": 0.09783374518156052,
"learning_rate": 0.0025746806182354023,
"loss": 1.5925,
"step": 39620
},
{
"epoch": 0.15564509757446474,
"grad_norm": 0.0943576991558075,
"learning_rate": 0.0025742387873387567,
"loss": 1.5825,
"step": 39640
},
{
"epoch": 0.15577677701403703,
"grad_norm": 0.09120535105466843,
"learning_rate": 0.0025737967650225906,
"loss": 1.5754,
"step": 39660
},
{
"epoch": 0.15590845645360935,
"grad_norm": 0.11549575626850128,
"learning_rate": 0.0025733545513656683,
"loss": 1.5741,
"step": 39680
},
{
"epoch": 0.15604013589318164,
"grad_norm": 0.08214199542999268,
"learning_rate": 0.0025729121464467897,
"loss": 1.5684,
"step": 39700
},
{
"epoch": 0.15617181533275395,
"grad_norm": 0.09407494962215424,
"learning_rate": 0.0025724695503447853,
"loss": 1.5623,
"step": 39720
},
{
"epoch": 0.15630349477232625,
"grad_norm": 0.10400024056434631,
"learning_rate": 0.0025720267631385227,
"loss": 1.5565,
"step": 39740
},
{
"epoch": 0.15643517421189856,
"grad_norm": 0.09701120853424072,
"learning_rate": 0.002571583784906902,
"loss": 1.5475,
"step": 39760
},
{
"epoch": 0.15656685365147086,
"grad_norm": 0.09145724773406982,
"learning_rate": 0.0025711406157288594,
"loss": 1.5366,
"step": 39780
},
{
"epoch": 0.15669853309104317,
"grad_norm": 0.10197409987449646,
"learning_rate": 0.0025706972556833615,
"loss": 1.5368,
"step": 39800
},
{
"epoch": 0.15683021253061546,
"grad_norm": 0.10949882119894028,
"learning_rate": 0.0025702537048494126,
"loss": 1.5324,
"step": 39820
},
{
"epoch": 0.15696189197018778,
"grad_norm": 0.08680877834558487,
"learning_rate": 0.0025698099633060484,
"loss": 1.5246,
"step": 39840
},
{
"epoch": 0.15709357140976007,
"grad_norm": 0.09298034757375717,
"learning_rate": 0.0025693660311323398,
"loss": 1.5244,
"step": 39860
},
{
"epoch": 0.1572252508493324,
"grad_norm": 0.08509939163923264,
"learning_rate": 0.002568921908407392,
"loss": 1.5269,
"step": 39880
},
{
"epoch": 0.15735693028890468,
"grad_norm": 0.13192257285118103,
"learning_rate": 0.002568477595210343,
"loss": 1.5189,
"step": 39900
},
{
"epoch": 0.157488609728477,
"grad_norm": 0.09820321202278137,
"learning_rate": 0.0025680330916203653,
"loss": 1.5172,
"step": 39920
},
{
"epoch": 0.1576202891680493,
"grad_norm": 0.12466151267290115,
"learning_rate": 0.0025675883977166656,
"loss": 1.5168,
"step": 39940
},
{
"epoch": 0.1577519686076216,
"grad_norm": 0.1055043414235115,
"learning_rate": 0.002567143513578485,
"loss": 1.5127,
"step": 39960
},
{
"epoch": 0.1578836480471939,
"grad_norm": 0.0885360836982727,
"learning_rate": 0.0025666984392850966,
"loss": 1.5102,
"step": 39980
},
{
"epoch": 0.15801532748676622,
"grad_norm": 0.09092732518911362,
"learning_rate": 0.0025662531749158085,
"loss": 1.5128,
"step": 40000
},
{
"epoch": 0.15801532748676622,
"eval_loss": 1.5180437564849854,
"eval_runtime": 66.3341,
"eval_samples_per_second": 15.075,
"eval_steps_per_second": 15.075,
"step": 40000
},
{
"epoch": 0.1581470069263385,
"grad_norm": 0.11039165407419205,
"learning_rate": 0.002565807720549964,
"loss": 1.5056,
"step": 40020
},
{
"epoch": 0.15827868636591083,
"grad_norm": 0.09053885191679001,
"learning_rate": 0.002565362076266938,
"loss": 1.5117,
"step": 40040
},
{
"epoch": 0.15841036580548312,
"grad_norm": 0.10280958563089371,
"learning_rate": 0.002564916242146141,
"loss": 1.5026,
"step": 40060
},
{
"epoch": 0.15854204524505544,
"grad_norm": 0.10042385011911392,
"learning_rate": 0.0025644702182670153,
"loss": 1.5079,
"step": 40080
},
{
"epoch": 0.15867372468462773,
"grad_norm": 0.15328729152679443,
"learning_rate": 0.0025640240047090394,
"loss": 1.5084,
"step": 40100
},
{
"epoch": 0.15880540412420005,
"grad_norm": 0.10443607717752457,
"learning_rate": 0.002563577601551724,
"loss": 1.5017,
"step": 40120
},
{
"epoch": 0.15893708356377234,
"grad_norm": 0.1254567801952362,
"learning_rate": 0.0025631310088746143,
"loss": 1.5015,
"step": 40140
},
{
"epoch": 0.15906876300334466,
"grad_norm": 0.11930776387453079,
"learning_rate": 0.002562684226757289,
"loss": 1.508,
"step": 40160
},
{
"epoch": 0.15920044244291695,
"grad_norm": 0.08289260417222977,
"learning_rate": 0.0025622372552793603,
"loss": 1.5091,
"step": 40180
},
{
"epoch": 0.15933212188248927,
"grad_norm": 0.10695404559373856,
"learning_rate": 0.0025617900945204743,
"loss": 1.5045,
"step": 40200
},
{
"epoch": 0.15946380132206156,
"grad_norm": 0.11500686407089233,
"learning_rate": 0.0025613427445603117,
"loss": 1.5029,
"step": 40220
},
{
"epoch": 0.15959548076163388,
"grad_norm": 0.09452733397483826,
"learning_rate": 0.0025608952054785856,
"loss": 1.5029,
"step": 40240
},
{
"epoch": 0.1597271602012062,
"grad_norm": 0.10225624591112137,
"learning_rate": 0.002560447477355043,
"loss": 1.5061,
"step": 40260
},
{
"epoch": 0.1598588396407785,
"grad_norm": 0.10620761662721634,
"learning_rate": 0.002559999560269466,
"loss": 1.5015,
"step": 40280
},
{
"epoch": 0.1599905190803508,
"grad_norm": 0.11584058403968811,
"learning_rate": 0.002559551454301669,
"loss": 1.5255,
"step": 40300
},
{
"epoch": 0.1601221985199231,
"grad_norm": 0.12006339430809021,
"learning_rate": 0.0025591031595314996,
"loss": 1.5512,
"step": 40320
},
{
"epoch": 0.16025387795949542,
"grad_norm": 0.10483147948980331,
"learning_rate": 0.0025586546760388413,
"loss": 1.5584,
"step": 40340
},
{
"epoch": 0.1603855573990677,
"grad_norm": 0.12490592896938324,
"learning_rate": 0.002558206003903608,
"loss": 1.5647,
"step": 40360
},
{
"epoch": 0.16051723683864003,
"grad_norm": 0.09851817041635513,
"learning_rate": 0.0025577571432057497,
"loss": 1.558,
"step": 40380
},
{
"epoch": 0.16064891627821232,
"grad_norm": 0.10723355412483215,
"learning_rate": 0.0025573080940252497,
"loss": 1.5505,
"step": 40400
},
{
"epoch": 0.16078059571778464,
"grad_norm": 0.08668304234743118,
"learning_rate": 0.002556858856442124,
"loss": 1.5473,
"step": 40420
},
{
"epoch": 0.16091227515735693,
"grad_norm": 0.13923218846321106,
"learning_rate": 0.002556409430536423,
"loss": 1.5451,
"step": 40440
},
{
"epoch": 0.16104395459692925,
"grad_norm": 0.11584249883890152,
"learning_rate": 0.00255595981638823,
"loss": 1.5435,
"step": 40460
},
{
"epoch": 0.16117563403650154,
"grad_norm": 0.09080822020769119,
"learning_rate": 0.0025555100140776618,
"loss": 1.5435,
"step": 40480
},
{
"epoch": 0.16130731347607385,
"grad_norm": 0.0972919836640358,
"learning_rate": 0.0025550600236848697,
"loss": 1.5367,
"step": 40500
},
{
"epoch": 0.16143899291564615,
"grad_norm": 0.10431429743766785,
"learning_rate": 0.0025546098452900374,
"loss": 1.5362,
"step": 40520
},
{
"epoch": 0.16157067235521846,
"grad_norm": 0.1297275573015213,
"learning_rate": 0.002554159478973383,
"loss": 1.5287,
"step": 40540
},
{
"epoch": 0.16170235179479076,
"grad_norm": 0.08693351596593857,
"learning_rate": 0.002553708924815157,
"loss": 1.5322,
"step": 40560
},
{
"epoch": 0.16183403123436307,
"grad_norm": 0.10223674029111862,
"learning_rate": 0.002553258182895645,
"loss": 1.5283,
"step": 40580
},
{
"epoch": 0.16196571067393536,
"grad_norm": 0.13661502301692963,
"learning_rate": 0.0025528072532951646,
"loss": 1.5335,
"step": 40600
},
{
"epoch": 0.16209739011350768,
"grad_norm": 0.0959714725613594,
"learning_rate": 0.0025523561360940666,
"loss": 1.5409,
"step": 40620
},
{
"epoch": 0.16222906955307997,
"grad_norm": 0.11499602347612381,
"learning_rate": 0.0025519048313727365,
"loss": 1.534,
"step": 40640
},
{
"epoch": 0.1623607489926523,
"grad_norm": 0.10685988515615463,
"learning_rate": 0.0025514533392115932,
"loss": 1.5268,
"step": 40660
},
{
"epoch": 0.16249242843222458,
"grad_norm": 0.12656660377979279,
"learning_rate": 0.002551001659691088,
"loss": 1.5253,
"step": 40680
},
{
"epoch": 0.1626241078717969,
"grad_norm": 0.11715365201234818,
"learning_rate": 0.002550549792891706,
"loss": 1.5259,
"step": 40700
},
{
"epoch": 0.1627557873113692,
"grad_norm": 0.1329299360513687,
"learning_rate": 0.0025500977388939667,
"loss": 1.525,
"step": 40720
},
{
"epoch": 0.1628874667509415,
"grad_norm": 0.0944843739271164,
"learning_rate": 0.00254964549777842,
"loss": 1.5223,
"step": 40740
},
{
"epoch": 0.1630191461905138,
"grad_norm": 0.09008379280567169,
"learning_rate": 0.002549193069625653,
"loss": 1.5215,
"step": 40760
},
{
"epoch": 0.16315082563008612,
"grad_norm": 0.1306624561548233,
"learning_rate": 0.0025487404545162825,
"loss": 1.5174,
"step": 40780
},
{
"epoch": 0.1632825050696584,
"grad_norm": 0.08844735473394394,
"learning_rate": 0.0025482876525309618,
"loss": 1.5239,
"step": 40800
},
{
"epoch": 0.16341418450923073,
"grad_norm": 0.09808750450611115,
"learning_rate": 0.0025478346637503764,
"loss": 1.5219,
"step": 40820
},
{
"epoch": 0.16354586394880302,
"grad_norm": 0.10559525340795517,
"learning_rate": 0.002547381488255243,
"loss": 1.5201,
"step": 40840
},
{
"epoch": 0.16367754338837534,
"grad_norm": 0.09977331012487411,
"learning_rate": 0.0025469281261263155,
"loss": 1.5204,
"step": 40860
},
{
"epoch": 0.16380922282794763,
"grad_norm": 0.11581449955701828,
"learning_rate": 0.0025464745774443766,
"loss": 1.5199,
"step": 40880
},
{
"epoch": 0.16394090226751995,
"grad_norm": 0.10969722270965576,
"learning_rate": 0.0025460208422902458,
"loss": 1.5318,
"step": 40900
},
{
"epoch": 0.16407258170709224,
"grad_norm": 0.12273216247558594,
"learning_rate": 0.0025455669207447747,
"loss": 1.5515,
"step": 40920
},
{
"epoch": 0.16420426114666456,
"grad_norm": 0.09553756564855576,
"learning_rate": 0.0025451128128888474,
"loss": 1.5507,
"step": 40940
},
{
"epoch": 0.16433594058623688,
"grad_norm": 0.1060953214764595,
"learning_rate": 0.002544658518803382,
"loss": 1.5528,
"step": 40960
},
{
"epoch": 0.16446762002580917,
"grad_norm": 0.12041070312261581,
"learning_rate": 0.00254420403856933,
"loss": 1.5417,
"step": 40980
},
{
"epoch": 0.1645992994653815,
"grad_norm": 0.09940062463283539,
"learning_rate": 0.0025437493722676747,
"loss": 1.5393,
"step": 41000
},
{
"epoch": 0.1645992994653815,
"eval_loss": 1.5645551681518555,
"eval_runtime": 67.891,
"eval_samples_per_second": 14.729,
"eval_steps_per_second": 14.729,
"step": 41000
},
{
"epoch": 0.16473097890495378,
"grad_norm": 0.09117773175239563,
"learning_rate": 0.0025432945199794343,
"loss": 1.5385,
"step": 41020
},
{
"epoch": 0.1648626583445261,
"grad_norm": 0.10133585333824158,
"learning_rate": 0.0025428394817856585,
"loss": 1.5357,
"step": 41040
},
{
"epoch": 0.1649943377840984,
"grad_norm": 0.09552034735679626,
"learning_rate": 0.0025423842577674315,
"loss": 1.5355,
"step": 41060
},
{
"epoch": 0.1651260172236707,
"grad_norm": 0.11098198592662811,
"learning_rate": 0.00254192884800587,
"loss": 1.5294,
"step": 41080
},
{
"epoch": 0.165257696663243,
"grad_norm": 0.11762163043022156,
"learning_rate": 0.0025414732525821243,
"loss": 1.5263,
"step": 41100
},
{
"epoch": 0.16538937610281532,
"grad_norm": 0.10004954785108566,
"learning_rate": 0.0025410174715773766,
"loss": 1.5232,
"step": 41120
},
{
"epoch": 0.1655210555423876,
"grad_norm": 0.10917594283819199,
"learning_rate": 0.0025405615050728427,
"loss": 1.5209,
"step": 41140
},
{
"epoch": 0.16565273498195993,
"grad_norm": 0.09700624644756317,
"learning_rate": 0.002540105353149773,
"loss": 1.5246,
"step": 41160
},
{
"epoch": 0.16578441442153222,
"grad_norm": 0.1017017513513565,
"learning_rate": 0.002539649015889448,
"loss": 1.5235,
"step": 41180
},
{
"epoch": 0.16591609386110454,
"grad_norm": 0.09013497084379196,
"learning_rate": 0.002539192493373184,
"loss": 1.5123,
"step": 41200
},
{
"epoch": 0.16604777330067683,
"grad_norm": 0.117029570043087,
"learning_rate": 0.0025387357856823277,
"loss": 1.5192,
"step": 41220
},
{
"epoch": 0.16617945274024915,
"grad_norm": 0.11237141489982605,
"learning_rate": 0.002538278892898262,
"loss": 1.5113,
"step": 41240
},
{
"epoch": 0.16631113217982144,
"grad_norm": 0.09884624928236008,
"learning_rate": 0.0025378218151024,
"loss": 1.5188,
"step": 41260
},
{
"epoch": 0.16644281161939375,
"grad_norm": 0.11448849737644196,
"learning_rate": 0.002537364552376189,
"loss": 1.5255,
"step": 41280
},
{
"epoch": 0.16657449105896605,
"grad_norm": 0.12878195941448212,
"learning_rate": 0.0025369071048011093,
"loss": 1.5255,
"step": 41300
},
{
"epoch": 0.16670617049853836,
"grad_norm": 0.12284272909164429,
"learning_rate": 0.0025364494724586734,
"loss": 1.5184,
"step": 41320
},
{
"epoch": 0.16683784993811066,
"grad_norm": 0.0931035578250885,
"learning_rate": 0.0025359916554304274,
"loss": 1.5149,
"step": 41340
},
{
"epoch": 0.16696952937768297,
"grad_norm": 0.09691374748945236,
"learning_rate": 0.0025355336537979498,
"loss": 1.5157,
"step": 41360
},
{
"epoch": 0.16710120881725526,
"grad_norm": 0.09920854866504669,
"learning_rate": 0.0025350754676428527,
"loss": 1.5215,
"step": 41380
},
{
"epoch": 0.16723288825682758,
"grad_norm": 0.13028231263160706,
"learning_rate": 0.0025346170970467806,
"loss": 1.5156,
"step": 41400
},
{
"epoch": 0.16736456769639987,
"grad_norm": 0.09974183887243271,
"learning_rate": 0.002534158542091411,
"loss": 1.5231,
"step": 41420
},
{
"epoch": 0.1674962471359722,
"grad_norm": 0.09403842687606812,
"learning_rate": 0.0025336998028584546,
"loss": 1.5189,
"step": 41440
},
{
"epoch": 0.16762792657554448,
"grad_norm": 0.10986328125,
"learning_rate": 0.0025332408794296528,
"loss": 1.5196,
"step": 41460
},
{
"epoch": 0.1677596060151168,
"grad_norm": 0.11757822334766388,
"learning_rate": 0.0025327817718867837,
"loss": 1.5365,
"step": 41480
},
{
"epoch": 0.1678912854546891,
"grad_norm": 0.11819227039813995,
"learning_rate": 0.002532322480311655,
"loss": 1.5616,
"step": 41500
},
{
"epoch": 0.1680229648942614,
"grad_norm": 0.12360888719558716,
"learning_rate": 0.0025318630047861082,
"loss": 1.5725,
"step": 41520
},
{
"epoch": 0.1681546443338337,
"grad_norm": 0.09366869181394577,
"learning_rate": 0.0025314033453920186,
"loss": 1.5816,
"step": 41540
},
{
"epoch": 0.16828632377340602,
"grad_norm": 0.09530407935380936,
"learning_rate": 0.0025309435022112916,
"loss": 1.5805,
"step": 41560
},
{
"epoch": 0.1684180032129783,
"grad_norm": 0.12878450751304626,
"learning_rate": 0.0025304834753258685,
"loss": 1.5807,
"step": 41580
},
{
"epoch": 0.16854968265255063,
"grad_norm": 0.1358455866575241,
"learning_rate": 0.0025300232648177213,
"loss": 1.5794,
"step": 41600
},
{
"epoch": 0.16868136209212295,
"grad_norm": 0.12388956546783447,
"learning_rate": 0.002529562870768855,
"loss": 1.5766,
"step": 41620
},
{
"epoch": 0.16881304153169524,
"grad_norm": 0.10921106487512589,
"learning_rate": 0.002529102293261308,
"loss": 1.5705,
"step": 41640
},
{
"epoch": 0.16894472097126756,
"grad_norm": 0.1032082810997963,
"learning_rate": 0.0025286415323771514,
"loss": 1.5692,
"step": 41660
},
{
"epoch": 0.16907640041083985,
"grad_norm": 0.10300302505493164,
"learning_rate": 0.0025281805881984887,
"loss": 1.567,
"step": 41680
},
{
"epoch": 0.16920807985041217,
"grad_norm": 0.10055007040500641,
"learning_rate": 0.002527719460807454,
"loss": 1.566,
"step": 41700
},
{
"epoch": 0.16933975928998446,
"grad_norm": 0.12738655507564545,
"learning_rate": 0.0025272581502862185,
"loss": 1.561,
"step": 41720
},
{
"epoch": 0.16947143872955678,
"grad_norm": 0.10861164331436157,
"learning_rate": 0.0025267966567169816,
"loss": 1.567,
"step": 41740
},
{
"epoch": 0.16960311816912907,
"grad_norm": 0.12459450215101242,
"learning_rate": 0.0025263349801819784,
"loss": 1.5651,
"step": 41760
},
{
"epoch": 0.1697347976087014,
"grad_norm": 0.09590265899896622,
"learning_rate": 0.0025258731207634753,
"loss": 1.5661,
"step": 41780
},
{
"epoch": 0.16986647704827368,
"grad_norm": 0.11365272849798203,
"learning_rate": 0.002525411078543771,
"loss": 1.5619,
"step": 41800
},
{
"epoch": 0.169998156487846,
"grad_norm": 0.08910445868968964,
"learning_rate": 0.0025249488536051965,
"loss": 1.5585,
"step": 41820
},
{
"epoch": 0.1701298359274183,
"grad_norm": 0.18229752779006958,
"learning_rate": 0.0025244864460301176,
"loss": 1.5526,
"step": 41840
},
{
"epoch": 0.1702615153669906,
"grad_norm": 0.09740415215492249,
"learning_rate": 0.0025240238559009307,
"loss": 1.5529,
"step": 41860
},
{
"epoch": 0.1703931948065629,
"grad_norm": 0.12560056149959564,
"learning_rate": 0.0025235610833000644,
"loss": 1.5509,
"step": 41880
},
{
"epoch": 0.17052487424613522,
"grad_norm": 0.15917159616947174,
"learning_rate": 0.002523098128309981,
"loss": 1.5542,
"step": 41900
},
{
"epoch": 0.1706565536857075,
"grad_norm": 0.13030411303043365,
"learning_rate": 0.002522634991013175,
"loss": 1.5513,
"step": 41920
},
{
"epoch": 0.17078823312527983,
"grad_norm": 0.09367945790290833,
"learning_rate": 0.0025221716714921728,
"loss": 1.5559,
"step": 41940
},
{
"epoch": 0.17091991256485212,
"grad_norm": 0.10787492990493774,
"learning_rate": 0.0025217081698295342,
"loss": 1.5554,
"step": 41960
},
{
"epoch": 0.17105159200442444,
"grad_norm": 0.10562490671873093,
"learning_rate": 0.0025212444861078503,
"loss": 1.5504,
"step": 41980
},
{
"epoch": 0.17118327144399673,
"grad_norm": 0.1048375815153122,
"learning_rate": 0.0025207806204097464,
"loss": 1.5566,
"step": 42000
},
{
"epoch": 0.17118327144399673,
"eval_loss": 1.424837350845337,
"eval_runtime": 66.5617,
"eval_samples_per_second": 15.024,
"eval_steps_per_second": 15.024,
"step": 42000
},
{
"epoch": 0.00013167943957230517,
"grad_norm": 0.10541951656341553,
"learning_rate": 0.0025203165728178776,
"loss": 1.4444,
"step": 42020
},
{
"epoch": 0.00026335887914461035,
"grad_norm": 0.12595529854297638,
"learning_rate": 0.0025198523434149345,
"loss": 1.435,
"step": 42040
},
{
"epoch": 0.00039503831871691555,
"grad_norm": 0.1330813616514206,
"learning_rate": 0.002519387932283637,
"loss": 1.4314,
"step": 42060
},
{
"epoch": 0.0005267177582892207,
"grad_norm": 0.10303393006324768,
"learning_rate": 0.00251892333950674,
"loss": 1.4189,
"step": 42080
},
{
"epoch": 0.0006583971978615259,
"grad_norm": 0.13066118955612183,
"learning_rate": 0.00251845856516703,
"loss": 1.4188,
"step": 42100
},
{
"epoch": 0.0007900766374338311,
"grad_norm": 0.09912826120853424,
"learning_rate": 0.002517993609347324,
"loss": 1.4279,
"step": 42120
},
{
"epoch": 0.0009217560770061363,
"grad_norm": 0.16035521030426025,
"learning_rate": 0.0025175284721304747,
"loss": 1.4217,
"step": 42140
},
{
"epoch": 0.0010534355165784414,
"grad_norm": 0.09864924103021622,
"learning_rate": 0.002517063153599363,
"loss": 1.4261,
"step": 42160
},
{
"epoch": 0.0011851149561507466,
"grad_norm": 0.09063073992729187,
"learning_rate": 0.002516597653836907,
"loss": 1.4148,
"step": 42180
},
{
"epoch": 0.0013167943957230518,
"grad_norm": 0.10235504806041718,
"learning_rate": 0.0025161319729260527,
"loss": 1.4225,
"step": 42200
},
{
"epoch": 0.001448473835295357,
"grad_norm": 0.10286398977041245,
"learning_rate": 0.002515666110949781,
"loss": 1.4209,
"step": 42220
},
{
"epoch": 0.0015801532748676622,
"grad_norm": 0.11597388982772827,
"learning_rate": 0.002515200067991104,
"loss": 1.4143,
"step": 42240
},
{
"epoch": 0.0017118327144399674,
"grad_norm": 0.1071164458990097,
"learning_rate": 0.0025147338441330663,
"loss": 1.4171,
"step": 42260
},
{
"epoch": 0.0018435121540122726,
"grad_norm": 0.11942466348409653,
"learning_rate": 0.0025142674394587447,
"loss": 1.4249,
"step": 42280
},
{
"epoch": 0.0019751915935845776,
"grad_norm": 0.11480249464511871,
"learning_rate": 0.002513800854051248,
"loss": 1.4203,
"step": 42300
},
{
"epoch": 0.002106871033156883,
"grad_norm": 0.10616378486156464,
"learning_rate": 0.002513334087993718,
"loss": 1.423,
"step": 42320
},
{
"epoch": 0.002238550472729188,
"grad_norm": 0.09758572280406952,
"learning_rate": 0.0025128671413693275,
"loss": 1.4221,
"step": 42340
},
{
"epoch": 0.002370229912301493,
"grad_norm": 0.16627156734466553,
"learning_rate": 0.002512400014261283,
"loss": 1.4268,
"step": 42360
},
{
"epoch": 0.0025019093518737984,
"grad_norm": 0.11762084066867828,
"learning_rate": 0.0025119327067528213,
"loss": 1.436,
"step": 42380
},
{
"epoch": 0.0026335887914461036,
"grad_norm": 0.11083631217479706,
"learning_rate": 0.0025114652189272128,
"loss": 1.4393,
"step": 42400
},
{
"epoch": 0.002765268231018409,
"grad_norm": 0.521308183670044,
"learning_rate": 0.0025109975508677594,
"loss": 1.4376,
"step": 42420
},
{
"epoch": 0.002896947670590714,
"grad_norm": 0.11644919961690903,
"learning_rate": 0.0025105297026577953,
"loss": 1.4641,
"step": 42440
},
{
"epoch": 0.003028627110163019,
"grad_norm": 0.09482905268669128,
"learning_rate": 0.002510061674380687,
"loss": 1.4611,
"step": 42460
},
{
"epoch": 0.0031603065497353244,
"grad_norm": 0.14098559319972992,
"learning_rate": 0.0025095934661198333,
"loss": 1.4756,
"step": 42480
},
{
"epoch": 0.0032919859893076296,
"grad_norm": 0.10550355911254883,
"learning_rate": 0.002509125077958663,
"loss": 1.5066,
"step": 42500
},
{
"epoch": 0.003423665428879935,
"grad_norm": 0.10194244980812073,
"learning_rate": 0.00250865650998064,
"loss": 1.5265,
"step": 42520
},
{
"epoch": 0.00355534486845224,
"grad_norm": 0.12069813162088394,
"learning_rate": 0.0025081877622692584,
"loss": 1.5486,
"step": 42540
},
{
"epoch": 0.0036870243080245452,
"grad_norm": 0.09516333788633347,
"learning_rate": 0.002507718834908045,
"loss": 1.5594,
"step": 42560
},
{
"epoch": 0.0038187037475968504,
"grad_norm": 0.11514731496572495,
"learning_rate": 0.002507249727980558,
"loss": 1.5632,
"step": 42580
},
{
"epoch": 0.003950383187169155,
"grad_norm": 0.10155905038118362,
"learning_rate": 0.002506780441570388,
"loss": 1.5779,
"step": 42600
},
{
"epoch": 0.004082062626741461,
"grad_norm": 0.09767820686101913,
"learning_rate": 0.002506310975761158,
"loss": 1.5785,
"step": 42620
},
{
"epoch": 0.004213742066313766,
"grad_norm": 0.09538809210062027,
"learning_rate": 0.0025058413306365216,
"loss": 1.5823,
"step": 42640
},
{
"epoch": 0.004345421505886071,
"grad_norm": 0.09154420346021652,
"learning_rate": 0.0025053715062801664,
"loss": 1.5665,
"step": 42660
},
{
"epoch": 0.004477100945458376,
"grad_norm": 0.1306425929069519,
"learning_rate": 0.0025049015027758096,
"loss": 1.5653,
"step": 42680
},
{
"epoch": 0.004608780385030682,
"grad_norm": 0.12897877395153046,
"learning_rate": 0.002504431320207203,
"loss": 1.5562,
"step": 42700
},
{
"epoch": 0.004740459824602986,
"grad_norm": 0.10444645583629608,
"learning_rate": 0.002503960958658127,
"loss": 1.5588,
"step": 42720
},
{
"epoch": 0.004872139264175292,
"grad_norm": 0.11443938314914703,
"learning_rate": 0.0025034904182123976,
"loss": 1.5489,
"step": 42740
},
{
"epoch": 0.005003818703747597,
"grad_norm": 0.11464277654886246,
"learning_rate": 0.002503019698953859,
"loss": 1.5547,
"step": 42760
},
{
"epoch": 0.0051354981433199024,
"grad_norm": 0.13487665355205536,
"learning_rate": 0.0025025488009663907,
"loss": 1.5458,
"step": 42780
},
{
"epoch": 0.005267177582892207,
"grad_norm": 0.11822563409805298,
"learning_rate": 0.002502077724333901,
"loss": 1.5472,
"step": 42800
},
{
"epoch": 0.005398857022464512,
"grad_norm": 0.08794966340065002,
"learning_rate": 0.002501606469140333,
"loss": 1.5441,
"step": 42820
},
{
"epoch": 0.005530536462036818,
"grad_norm": 0.09283588081598282,
"learning_rate": 0.0025011350354696583,
"loss": 1.5405,
"step": 42840
},
{
"epoch": 0.005662215901609122,
"grad_norm": 0.11356227099895477,
"learning_rate": 0.0025006634234058835,
"loss": 1.534,
"step": 42860
},
{
"epoch": 0.005793895341181428,
"grad_norm": 0.10243146866559982,
"learning_rate": 0.0025001916330330454,
"loss": 1.5381,
"step": 42880
},
{
"epoch": 0.005925574780753733,
"grad_norm": 0.13794657588005066,
"learning_rate": 0.0024997196644352114,
"loss": 1.5302,
"step": 42900
},
{
"epoch": 0.006057254220326038,
"grad_norm": 0.11851724237203598,
"learning_rate": 0.0024992475176964834,
"loss": 1.5267,
"step": 42920
},
{
"epoch": 0.006188933659898343,
"grad_norm": 0.1327144056558609,
"learning_rate": 0.002498775192900993,
"loss": 1.5292,
"step": 42940
},
{
"epoch": 0.006320613099470649,
"grad_norm": 0.09289969503879547,
"learning_rate": 0.0024983026901329044,
"loss": 1.5283,
"step": 42960
},
{
"epoch": 0.006452292539042954,
"grad_norm": 0.10237723588943481,
"learning_rate": 0.002497830009476413,
"loss": 1.5254,
"step": 42980
},
{
"epoch": 0.006583971978615259,
"grad_norm": 0.10176314413547516,
"learning_rate": 0.0024973571510157467,
"loss": 1.5199,
"step": 43000
},
{
"epoch": 0.006583971978615259,
"eval_loss": 1.4149765968322754,
"eval_runtime": 65.3786,
"eval_samples_per_second": 15.296,
"eval_steps_per_second": 15.296,
"step": 43000
},
{
"epoch": 0.006715651418187564,
"grad_norm": 0.09919629245996475,
"learning_rate": 0.0024968841148351635,
"loss": 1.5191,
"step": 43020
},
{
"epoch": 0.00684733085775987,
"grad_norm": 0.10323656350374222,
"learning_rate": 0.0024964109010189557,
"loss": 1.5233,
"step": 43040
},
{
"epoch": 0.006979010297332174,
"grad_norm": 0.1806810349225998,
"learning_rate": 0.002495937509651444,
"loss": 1.5246,
"step": 43060
},
{
"epoch": 0.00711068973690448,
"grad_norm": 0.11572176963090897,
"learning_rate": 0.0024954639408169836,
"loss": 1.5231,
"step": 43080
},
{
"epoch": 0.007242369176476785,
"grad_norm": 0.11550699919462204,
"learning_rate": 0.0024949901945999593,
"loss": 1.5218,
"step": 43100
},
{
"epoch": 0.0073740486160490904,
"grad_norm": 0.10549616813659668,
"learning_rate": 0.002494516271084789,
"loss": 1.5182,
"step": 43120
},
{
"epoch": 0.007505728055621395,
"grad_norm": 0.09112010896205902,
"learning_rate": 0.0024940421703559218,
"loss": 1.5215,
"step": 43140
},
{
"epoch": 0.007637407495193701,
"grad_norm": 0.10110776126384735,
"learning_rate": 0.002493567892497837,
"loss": 1.5225,
"step": 43160
},
{
"epoch": 0.007769086934766006,
"grad_norm": 0.12719328701496124,
"learning_rate": 0.002493093437595047,
"loss": 1.5472,
"step": 43180
},
{
"epoch": 0.00790076637433831,
"grad_norm": 0.13183355331420898,
"learning_rate": 0.002492618805732096,
"loss": 1.5569,
"step": 43200
},
{
"epoch": 0.008032445813910615,
"grad_norm": 0.1020386666059494,
"learning_rate": 0.0024921439969935585,
"loss": 1.561,
"step": 43220
},
{
"epoch": 0.008164125253482922,
"grad_norm": 0.14664006233215332,
"learning_rate": 0.002491669011464041,
"loss": 1.5541,
"step": 43240
},
{
"epoch": 0.008295804693055226,
"grad_norm": 0.09918078035116196,
"learning_rate": 0.0024911938492281813,
"loss": 1.5547,
"step": 43260
},
{
"epoch": 0.008427484132627531,
"grad_norm": 0.10724213719367981,
"learning_rate": 0.0024907185103706497,
"loss": 1.5512,
"step": 43280
},
{
"epoch": 0.008559163572199836,
"grad_norm": 0.0950016900897026,
"learning_rate": 0.0024902429949761468,
"loss": 1.5441,
"step": 43300
},
{
"epoch": 0.008690843011772142,
"grad_norm": 0.10287702083587646,
"learning_rate": 0.002489767303129405,
"loss": 1.5428,
"step": 43320
},
{
"epoch": 0.008822522451344447,
"grad_norm": 0.09938202053308487,
"learning_rate": 0.0024892914349151887,
"loss": 1.5466,
"step": 43340
},
{
"epoch": 0.008954201890916752,
"grad_norm": 0.09565220773220062,
"learning_rate": 0.002488815390418293,
"loss": 1.5379,
"step": 43360
},
{
"epoch": 0.009085881330489057,
"grad_norm": 0.13361500203609467,
"learning_rate": 0.0024883391697235442,
"loss": 1.5327,
"step": 43380
},
{
"epoch": 0.009217560770061363,
"grad_norm": 0.09708066284656525,
"learning_rate": 0.002487862772915802,
"loss": 1.5391,
"step": 43400
},
{
"epoch": 0.009349240209633668,
"grad_norm": 0.10566909611225128,
"learning_rate": 0.0024873862000799538,
"loss": 1.5424,
"step": 43420
},
{
"epoch": 0.009480919649205973,
"grad_norm": 0.08183527737855911,
"learning_rate": 0.002486909451300922,
"loss": 1.5419,
"step": 43440
},
{
"epoch": 0.009612599088778278,
"grad_norm": 0.09500976651906967,
"learning_rate": 0.0024864325266636587,
"loss": 1.5366,
"step": 43460
},
{
"epoch": 0.009744278528350584,
"grad_norm": 0.11120256781578064,
"learning_rate": 0.0024859554262531467,
"loss": 1.5349,
"step": 43480
},
{
"epoch": 0.009875957967922889,
"grad_norm": 0.13951987028121948,
"learning_rate": 0.0024854781501544017,
"loss": 1.5282,
"step": 43500
},
{
"epoch": 0.010007637407495194,
"grad_norm": 0.10958447307348251,
"learning_rate": 0.0024850006984524693,
"loss": 1.5272,
"step": 43520
},
{
"epoch": 0.010139316847067498,
"grad_norm": 0.09942590445280075,
"learning_rate": 0.002484523071232428,
"loss": 1.5326,
"step": 43540
},
{
"epoch": 0.010270996286639805,
"grad_norm": 0.1157267838716507,
"learning_rate": 0.002484045268579386,
"loss": 1.5296,
"step": 43560
},
{
"epoch": 0.01040267572621211,
"grad_norm": 0.1331472247838974,
"learning_rate": 0.0024835672905784835,
"loss": 1.5249,
"step": 43580
},
{
"epoch": 0.010534355165784414,
"grad_norm": 0.13041837513446808,
"learning_rate": 0.0024830891373148916,
"loss": 1.5287,
"step": 43600
},
{
"epoch": 0.01066603460535672,
"grad_norm": 0.13223400712013245,
"learning_rate": 0.0024826108088738122,
"loss": 1.5229,
"step": 43620
},
{
"epoch": 0.010797714044929024,
"grad_norm": 0.11160468310117722,
"learning_rate": 0.002482132305340481,
"loss": 1.5257,
"step": 43640
},
{
"epoch": 0.01092939348450133,
"grad_norm": 0.1368405967950821,
"learning_rate": 0.002481653626800161,
"loss": 1.5232,
"step": 43660
},
{
"epoch": 0.011061072924073635,
"grad_norm": 0.11044129729270935,
"learning_rate": 0.002481174773338149,
"loss": 1.5258,
"step": 43680
},
{
"epoch": 0.01119275236364594,
"grad_norm": 0.11385578662157059,
"learning_rate": 0.002480695745039773,
"loss": 1.5252,
"step": 43700
},
{
"epoch": 0.011324431803218245,
"grad_norm": 0.13926897943019867,
"learning_rate": 0.00248021654199039,
"loss": 1.5145,
"step": 43720
},
{
"epoch": 0.011456111242790551,
"grad_norm": 0.10542988032102585,
"learning_rate": 0.002479737164275391,
"loss": 1.518,
"step": 43740
},
{
"epoch": 0.011587790682362856,
"grad_norm": 0.19769559800624847,
"learning_rate": 0.002479257611980196,
"loss": 1.5328,
"step": 43760
},
{
"epoch": 0.01171947012193516,
"grad_norm": 0.14825715124607086,
"learning_rate": 0.002478777885190257,
"loss": 1.5437,
"step": 43780
},
{
"epoch": 0.011851149561507466,
"grad_norm": 0.12765994668006897,
"learning_rate": 0.002478297983991057,
"loss": 1.5491,
"step": 43800
},
{
"epoch": 0.011982829001079772,
"grad_norm": 0.12340036034584045,
"learning_rate": 0.00247781790846811,
"loss": 1.5623,
"step": 43820
},
{
"epoch": 0.012114508440652077,
"grad_norm": 0.12714795768260956,
"learning_rate": 0.002477337658706961,
"loss": 1.5452,
"step": 43840
},
{
"epoch": 0.012246187880224382,
"grad_norm": 0.10861831903457642,
"learning_rate": 0.0024768572347931856,
"loss": 1.5451,
"step": 43860
},
{
"epoch": 0.012377867319796686,
"grad_norm": 0.09523173421621323,
"learning_rate": 0.002476376636812392,
"loss": 1.5425,
"step": 43880
},
{
"epoch": 0.012509546759368993,
"grad_norm": 0.09822442382574081,
"learning_rate": 0.002475895864850217,
"loss": 1.545,
"step": 43900
},
{
"epoch": 0.012641226198941298,
"grad_norm": 0.11365661770105362,
"learning_rate": 0.0024754149189923315,
"loss": 1.5376,
"step": 43920
},
{
"epoch": 0.012772905638513602,
"grad_norm": 0.10581135004758835,
"learning_rate": 0.002474933799324434,
"loss": 1.5364,
"step": 43940
},
{
"epoch": 0.012904585078085907,
"grad_norm": 0.11580084264278412,
"learning_rate": 0.002474452505932257,
"loss": 1.5321,
"step": 43960
},
{
"epoch": 0.013036264517658214,
"grad_norm": 0.08592469990253448,
"learning_rate": 0.0024739710389015614,
"loss": 1.5331,
"step": 43980
},
{
"epoch": 0.013167943957230518,
"grad_norm": 0.10360794514417648,
"learning_rate": 0.0024734893983181408,
"loss": 1.5342,
"step": 44000
},
{
"epoch": 0.013167943957230518,
"eval_loss": 1.4869463443756104,
"eval_runtime": 63.1265,
"eval_samples_per_second": 15.841,
"eval_steps_per_second": 15.841,
"step": 44000
},
{
"epoch": 0.013299623396802823,
"grad_norm": 0.11372421681880951,
"learning_rate": 0.002473007584267819,
"loss": 1.5213,
"step": 44020
},
{
"epoch": 0.013431302836375128,
"grad_norm": 0.1096460372209549,
"learning_rate": 0.002472525596836451,
"loss": 1.5294,
"step": 44040
},
{
"epoch": 0.013562982275947433,
"grad_norm": 0.12670129537582397,
"learning_rate": 0.0024720434361099226,
"loss": 1.5169,
"step": 44060
},
{
"epoch": 0.01369466171551974,
"grad_norm": 0.09985670447349548,
"learning_rate": 0.00247156110217415,
"loss": 1.513,
"step": 44080
},
{
"epoch": 0.013826341155092044,
"grad_norm": 0.1046002060174942,
"learning_rate": 0.002471078595115081,
"loss": 1.5224,
"step": 44100
},
{
"epoch": 0.013958020594664349,
"grad_norm": 0.15750165283679962,
"learning_rate": 0.0024705959150186944,
"loss": 1.5242,
"step": 44120
},
{
"epoch": 0.014089700034236654,
"grad_norm": 0.1028977781534195,
"learning_rate": 0.0024701130619709986,
"loss": 1.5234,
"step": 44140
},
{
"epoch": 0.01422137947380896,
"grad_norm": 0.16695408523082733,
"learning_rate": 0.0024696300360580337,
"loss": 1.522,
"step": 44160
},
{
"epoch": 0.014353058913381265,
"grad_norm": 0.12498366087675095,
"learning_rate": 0.0024691468373658713,
"loss": 1.5188,
"step": 44180
},
{
"epoch": 0.01448473835295357,
"grad_norm": 0.09633167088031769,
"learning_rate": 0.002468663465980612,
"loss": 1.5245,
"step": 44200
},
{
"epoch": 0.014616417792525874,
"grad_norm": 0.1630498468875885,
"learning_rate": 0.002468179921988389,
"loss": 1.5192,
"step": 44220
},
{
"epoch": 0.014748097232098181,
"grad_norm": 0.11872150003910065,
"learning_rate": 0.0024676962054753643,
"loss": 1.5278,
"step": 44240
},
{
"epoch": 0.014879776671670486,
"grad_norm": 0.17083382606506348,
"learning_rate": 0.0024672123165277323,
"loss": 1.5212,
"step": 44260
},
{
"epoch": 0.01501145611124279,
"grad_norm": 0.12562261521816254,
"learning_rate": 0.002466728255231718,
"loss": 1.5217,
"step": 44280
},
{
"epoch": 0.015143135550815095,
"grad_norm": 0.11627357453107834,
"learning_rate": 0.002466244021673577,
"loss": 1.521,
"step": 44300
},
{
"epoch": 0.015274814990387402,
"grad_norm": 0.10252583771944046,
"learning_rate": 0.0024657596159395937,
"loss": 1.5237,
"step": 44320
},
{
"epoch": 0.015406494429959706,
"grad_norm": 0.1185808777809143,
"learning_rate": 0.0024652750381160865,
"loss": 1.5174,
"step": 44340
},
{
"epoch": 0.015538173869532011,
"grad_norm": 0.0919899195432663,
"learning_rate": 0.002464790288289401,
"loss": 1.5184,
"step": 44360
},
{
"epoch": 0.015669853309104316,
"grad_norm": 0.16310234367847443,
"learning_rate": 0.0024643053665459173,
"loss": 1.5144,
"step": 44380
},
{
"epoch": 0.01580153274867662,
"grad_norm": 0.16470354795455933,
"learning_rate": 0.0024638202729720424,
"loss": 1.4866,
"step": 44400
},
{
"epoch": 0.015933212188248926,
"grad_norm": 0.12554654479026794,
"learning_rate": 0.0024633350076542155,
"loss": 1.4843,
"step": 44420
},
{
"epoch": 0.01606489162782123,
"grad_norm": 0.13595227897167206,
"learning_rate": 0.0024628495706789074,
"loss": 1.4784,
"step": 44440
},
{
"epoch": 0.01619657106739354,
"grad_norm": 0.10951948165893555,
"learning_rate": 0.002462363962132618,
"loss": 1.4678,
"step": 44460
},
{
"epoch": 0.016328250506965843,
"grad_norm": 0.14208072423934937,
"learning_rate": 0.0024618781821018785,
"loss": 1.4665,
"step": 44480
},
{
"epoch": 0.016459929946538148,
"grad_norm": 0.10121913254261017,
"learning_rate": 0.0024613922306732506,
"loss": 1.4681,
"step": 44500
},
{
"epoch": 0.016591609386110453,
"grad_norm": 0.11362706124782562,
"learning_rate": 0.0024609061079333256,
"loss": 1.4584,
"step": 44520
},
{
"epoch": 0.016723288825682758,
"grad_norm": 0.14318877458572388,
"learning_rate": 0.0024604198139687268,
"loss": 1.4655,
"step": 44540
},
{
"epoch": 0.016854968265255062,
"grad_norm": 0.12110181897878647,
"learning_rate": 0.002459933348866107,
"loss": 1.4528,
"step": 44560
},
{
"epoch": 0.016986647704827367,
"grad_norm": 0.11001115292310715,
"learning_rate": 0.0024594467127121507,
"loss": 1.4501,
"step": 44580
},
{
"epoch": 0.017118327144399672,
"grad_norm": 0.16570629179477692,
"learning_rate": 0.0024589599055935708,
"loss": 1.4536,
"step": 44600
},
{
"epoch": 0.01725000658397198,
"grad_norm": 0.11245054006576538,
"learning_rate": 0.002458472927597112,
"loss": 1.4548,
"step": 44620
},
{
"epoch": 0.017381686023544285,
"grad_norm": 0.13176459074020386,
"learning_rate": 0.0024579857788095505,
"loss": 1.4485,
"step": 44640
},
{
"epoch": 0.01751336546311659,
"grad_norm": 0.09991902112960815,
"learning_rate": 0.002457498459317691,
"loss": 1.4534,
"step": 44660
},
{
"epoch": 0.017645044902688894,
"grad_norm": 0.0981200635433197,
"learning_rate": 0.002457010969208369,
"loss": 1.4469,
"step": 44680
},
{
"epoch": 0.0177767243422612,
"grad_norm": 0.11083146929740906,
"learning_rate": 0.0024565233085684507,
"loss": 1.442,
"step": 44700
},
{
"epoch": 0.017908403781833504,
"grad_norm": 0.09444429725408554,
"learning_rate": 0.002456035477484834,
"loss": 1.4514,
"step": 44720
},
{
"epoch": 0.01804008322140581,
"grad_norm": 0.11763214319944382,
"learning_rate": 0.0024555474760444445,
"loss": 1.4521,
"step": 44740
},
{
"epoch": 0.018171762660978114,
"grad_norm": 0.12316908687353134,
"learning_rate": 0.00245505930433424,
"loss": 1.449,
"step": 44760
},
{
"epoch": 0.018303442100550422,
"grad_norm": 0.1016848236322403,
"learning_rate": 0.0024545709624412093,
"loss": 1.4494,
"step": 44780
},
{
"epoch": 0.018435121540122727,
"grad_norm": 0.10764171183109283,
"learning_rate": 0.002454082450452369,
"loss": 1.4399,
"step": 44800
},
{
"epoch": 0.01856680097969503,
"grad_norm": 0.11485065519809723,
"learning_rate": 0.0024535937684547686,
"loss": 1.4497,
"step": 44820
},
{
"epoch": 0.018698480419267336,
"grad_norm": 0.1278896927833557,
"learning_rate": 0.0024531049165354853,
"loss": 1.4439,
"step": 44840
},
{
"epoch": 0.01883015985883964,
"grad_norm": 0.14847633242607117,
"learning_rate": 0.0024526158947816294,
"loss": 1.4523,
"step": 44860
},
{
"epoch": 0.018961839298411946,
"grad_norm": 0.105763278901577,
"learning_rate": 0.00245212670328034,
"loss": 1.4496,
"step": 44880
},
{
"epoch": 0.01909351873798425,
"grad_norm": 0.1055736318230629,
"learning_rate": 0.0024516373421187856,
"loss": 1.446,
"step": 44900
},
{
"epoch": 0.019225198177556555,
"grad_norm": 0.0994647964835167,
"learning_rate": 0.002451147811384167,
"loss": 1.4465,
"step": 44920
},
{
"epoch": 0.01935687761712886,
"grad_norm": 0.10782650858163834,
"learning_rate": 0.0024506581111637137,
"loss": 1.4587,
"step": 44940
},
{
"epoch": 0.019488557056701168,
"grad_norm": 0.12616658210754395,
"learning_rate": 0.0024501682415446853,
"loss": 1.496,
"step": 44960
},
{
"epoch": 0.019620236496273473,
"grad_norm": 0.12615470588207245,
"learning_rate": 0.002449678202614372,
"loss": 1.5177,
"step": 44980
},
{
"epoch": 0.019751915935845778,
"grad_norm": 0.10382698476314545,
"learning_rate": 0.0024491879944600957,
"loss": 1.5299,
"step": 45000
},
{
"epoch": 0.019751915935845778,
"eval_loss": 1.5385295152664185,
"eval_runtime": 66.2896,
"eval_samples_per_second": 15.085,
"eval_steps_per_second": 15.085,
"step": 45000
},
{
"epoch": 0.019883595375418082,
"grad_norm": 0.11794433742761612,
"learning_rate": 0.0024486976171692056,
"loss": 1.528,
"step": 45020
},
{
"epoch": 0.020015274814990387,
"grad_norm": 0.1409338116645813,
"learning_rate": 0.002448207070829083,
"loss": 1.5341,
"step": 45040
},
{
"epoch": 0.020146954254562692,
"grad_norm": 0.12568840384483337,
"learning_rate": 0.002447716355527138,
"loss": 1.5318,
"step": 45060
},
{
"epoch": 0.020278633694134997,
"grad_norm": 0.15237917006015778,
"learning_rate": 0.0024472254713508133,
"loss": 1.5449,
"step": 45080
},
{
"epoch": 0.0204103131337073,
"grad_norm": 0.11090464144945145,
"learning_rate": 0.002446734418387578,
"loss": 1.5253,
"step": 45100
},
{
"epoch": 0.02054199257327961,
"grad_norm": 0.11170685291290283,
"learning_rate": 0.0024462431967249344,
"loss": 1.5203,
"step": 45120
},
{
"epoch": 0.020673672012851915,
"grad_norm": 0.10791482031345367,
"learning_rate": 0.0024457518064504133,
"loss": 1.5176,
"step": 45140
},
{
"epoch": 0.02080535145242422,
"grad_norm": 0.09597095102071762,
"learning_rate": 0.002445260247651576,
"loss": 1.5193,
"step": 45160
},
{
"epoch": 0.020937030891996524,
"grad_norm": 0.34346190094947815,
"learning_rate": 0.0024447685204160145,
"loss": 1.5182,
"step": 45180
},
{
"epoch": 0.02106871033156883,
"grad_norm": 0.15261825919151306,
"learning_rate": 0.0024442766248313494,
"loss": 1.5151,
"step": 45200
},
{
"epoch": 0.021200389771141134,
"grad_norm": 0.1070566177368164,
"learning_rate": 0.0024437845609852314,
"loss": 1.516,
"step": 45220
},
{
"epoch": 0.02133206921071344,
"grad_norm": 0.10885826498270035,
"learning_rate": 0.0024432923289653425,
"loss": 1.5128,
"step": 45240
},
{
"epoch": 0.021463748650285743,
"grad_norm": 0.13303355872631073,
"learning_rate": 0.002442799928859394,
"loss": 1.5122,
"step": 45260
},
{
"epoch": 0.021595428089858048,
"grad_norm": 0.10217521339654922,
"learning_rate": 0.002442307360755127,
"loss": 1.5032,
"step": 45280
},
{
"epoch": 0.021727107529430356,
"grad_norm": 0.11426650732755661,
"learning_rate": 0.0024418146247403125,
"loss": 1.5029,
"step": 45300
},
{
"epoch": 0.02185878696900266,
"grad_norm": 0.09248542040586472,
"learning_rate": 0.0024413217209027518,
"loss": 1.4998,
"step": 45320
},
{
"epoch": 0.021990466408574966,
"grad_norm": 0.12633563578128815,
"learning_rate": 0.0024408286493302757,
"loss": 1.4982,
"step": 45340
},
{
"epoch": 0.02212214584814727,
"grad_norm": 0.16023258864879608,
"learning_rate": 0.0024403354101107445,
"loss": 1.5003,
"step": 45360
},
{
"epoch": 0.022253825287719575,
"grad_norm": 0.12979178130626678,
"learning_rate": 0.00243984200333205,
"loss": 1.4963,
"step": 45380
},
{
"epoch": 0.02238550472729188,
"grad_norm": 0.127953439950943,
"learning_rate": 0.002439348429082112,
"loss": 1.4973,
"step": 45400
},
{
"epoch": 0.022517184166864185,
"grad_norm": 0.10096823424100876,
"learning_rate": 0.002438854687448881,
"loss": 1.4964,
"step": 45420
},
{
"epoch": 0.02264886360643649,
"grad_norm": 0.1225760206580162,
"learning_rate": 0.0024383607785203377,
"loss": 1.5038,
"step": 45440
},
{
"epoch": 0.022780543046008798,
"grad_norm": 0.15798920392990112,
"learning_rate": 0.002437866702384491,
"loss": 1.5002,
"step": 45460
},
{
"epoch": 0.022912222485581103,
"grad_norm": 0.11615593731403351,
"learning_rate": 0.0024373724591293827,
"loss": 1.4992,
"step": 45480
},
{
"epoch": 0.023043901925153407,
"grad_norm": 0.11516784876585007,
"learning_rate": 0.0024368780488430806,
"loss": 1.4973,
"step": 45500
},
{
"epoch": 0.023175581364725712,
"grad_norm": 0.13365384936332703,
"learning_rate": 0.002436383471613685,
"loss": 1.4992,
"step": 45520
},
{
"epoch": 0.023307260804298017,
"grad_norm": 0.13123133778572083,
"learning_rate": 0.0024358887275293243,
"loss": 1.5064,
"step": 45540
},
{
"epoch": 0.02343894024387032,
"grad_norm": 0.106318898499012,
"learning_rate": 0.0024353938166781584,
"loss": 1.5163,
"step": 45560
},
{
"epoch": 0.023570619683442626,
"grad_norm": 0.10438498854637146,
"learning_rate": 0.0024348987391483753,
"loss": 1.5152,
"step": 45580
},
{
"epoch": 0.02370229912301493,
"grad_norm": 0.1130092591047287,
"learning_rate": 0.0024344034950281933,
"loss": 1.519,
"step": 45600
},
{
"epoch": 0.023833978562587236,
"grad_norm": 0.12775199115276337,
"learning_rate": 0.0024339080844058606,
"loss": 1.5139,
"step": 45620
},
{
"epoch": 0.023965658002159544,
"grad_norm": 0.09360072016716003,
"learning_rate": 0.002433412507369654,
"loss": 1.5066,
"step": 45640
},
{
"epoch": 0.02409733744173185,
"grad_norm": 0.1027098149061203,
"learning_rate": 0.002432916764007882,
"loss": 1.5034,
"step": 45660
},
{
"epoch": 0.024229016881304154,
"grad_norm": 0.11048934608697891,
"learning_rate": 0.0024324208544088803,
"loss": 1.4977,
"step": 45680
},
{
"epoch": 0.02436069632087646,
"grad_norm": 0.11964282393455505,
"learning_rate": 0.002431924778661017,
"loss": 1.4941,
"step": 45700
},
{
"epoch": 0.024492375760448763,
"grad_norm": 0.12463732808828354,
"learning_rate": 0.002431428536852687,
"loss": 1.4987,
"step": 45720
},
{
"epoch": 0.024624055200021068,
"grad_norm": 0.13735800981521606,
"learning_rate": 0.0024309321290723164,
"loss": 1.4951,
"step": 45740
},
{
"epoch": 0.024755734639593373,
"grad_norm": 0.11579196900129318,
"learning_rate": 0.0024304355554083607,
"loss": 1.4909,
"step": 45760
},
{
"epoch": 0.024887414079165678,
"grad_norm": 0.1210319772362709,
"learning_rate": 0.002429938815949304,
"loss": 1.49,
"step": 45780
},
{
"epoch": 0.025019093518737986,
"grad_norm": 0.11229152232408524,
"learning_rate": 0.0024294419107836625,
"loss": 1.4849,
"step": 45800
},
{
"epoch": 0.02515077295831029,
"grad_norm": 0.09796669334173203,
"learning_rate": 0.002428944839999978,
"loss": 1.4831,
"step": 45820
},
{
"epoch": 0.025282452397882595,
"grad_norm": 0.12028352171182632,
"learning_rate": 0.0024284476036868256,
"loss": 1.4836,
"step": 45840
},
{
"epoch": 0.0254141318374549,
"grad_norm": 0.11071626096963882,
"learning_rate": 0.002427950201932807,
"loss": 1.4798,
"step": 45860
},
{
"epoch": 0.025545811277027205,
"grad_norm": 0.10366615653038025,
"learning_rate": 0.002427452634826556,
"loss": 1.4781,
"step": 45880
},
{
"epoch": 0.02567749071659951,
"grad_norm": 0.10610003024339676,
"learning_rate": 0.0024269549024567333,
"loss": 1.4838,
"step": 45900
},
{
"epoch": 0.025809170156171814,
"grad_norm": 0.0969921201467514,
"learning_rate": 0.002426457004912031,
"loss": 1.4874,
"step": 45920
},
{
"epoch": 0.02594084959574412,
"grad_norm": 0.11021365970373154,
"learning_rate": 0.00242595894228117,
"loss": 1.4853,
"step": 45940
},
{
"epoch": 0.026072529035316427,
"grad_norm": 0.11574053019285202,
"learning_rate": 0.0024254607146528993,
"loss": 1.4812,
"step": 45960
},
{
"epoch": 0.026204208474888732,
"grad_norm": 0.09534565359354019,
"learning_rate": 0.002424962322116,
"loss": 1.478,
"step": 45980
},
{
"epoch": 0.026335887914461037,
"grad_norm": 0.10188112407922745,
"learning_rate": 0.0024244637647592797,
"loss": 1.4782,
"step": 46000
},
{
"epoch": 0.026335887914461037,
"eval_loss": 1.558879017829895,
"eval_runtime": 77.2288,
"eval_samples_per_second": 12.949,
"eval_steps_per_second": 12.949,
"step": 46000
},
{
"epoch": 2e-06,
"grad_norm": 0.1454385668039322,
"learning_rate": 0.000690285,
"loss": 2.076281929016113,
"step": 46020
},
{
"epoch": 4e-06,
"grad_norm": 0.07851192355155945,
"learning_rate": 0.0006905850000000001,
"loss": 2.036176300048828,
"step": 46040
},
{
"epoch": 6e-06,
"grad_norm": 0.057373788207769394,
"learning_rate": 0.000690885,
"loss": 2.018076515197754,
"step": 46060
},
{
"epoch": 8e-06,
"grad_norm": 0.058911461383104324,
"learning_rate": 0.000691185,
"loss": 2.0062496185302736,
"step": 46080
},
{
"epoch": 1e-05,
"grad_norm": 0.08635017275810242,
"learning_rate": 0.000691485,
"loss": 2.0066757202148438,
"step": 46100
},
{
"epoch": 1.2e-05,
"grad_norm": 0.0559137687087059,
"learning_rate": 0.000691785,
"loss": 1.999479103088379,
"step": 46120
},
{
"epoch": 1.4e-05,
"grad_norm": 0.07066166400909424,
"learning_rate": 0.000692085,
"loss": 1.9976621627807618,
"step": 46140
},
{
"epoch": 1.6e-05,
"grad_norm": 0.06597048789262772,
"learning_rate": 0.000692385,
"loss": 1.9841796875,
"step": 46160
},
{
"epoch": 1.8e-05,
"grad_norm": 0.07282619923353195,
"learning_rate": 0.000692685,
"loss": 1.9873577117919923,
"step": 46180
},
{
"epoch": 2e-05,
"grad_norm": 0.06868898123502731,
"learning_rate": 0.000692985,
"loss": 1.9878196716308594,
"step": 46200
},
{
"epoch": 2.2e-05,
"grad_norm": 0.056995589286088943,
"learning_rate": 0.000693285,
"loss": 1.9771448135375977,
"step": 46220
},
{
"epoch": 2.4e-05,
"grad_norm": 0.0641326829791069,
"learning_rate": 0.000693585,
"loss": 1.9761754989624023,
"step": 46240
},
{
"epoch": 2.6e-05,
"grad_norm": 0.07175535708665848,
"learning_rate": 0.000693885,
"loss": 1.970853042602539,
"step": 46260
},
{
"epoch": 2.8e-05,
"grad_norm": 0.06924993544816971,
"learning_rate": 0.0006941849999999999,
"loss": 1.9718612670898437,
"step": 46280
},
{
"epoch": 3e-05,
"grad_norm": 0.06896559149026871,
"learning_rate": 0.000694485,
"loss": 1.9643774032592773,
"step": 46300
},
{
"epoch": 3.2e-05,
"grad_norm": 0.058981869369745255,
"learning_rate": 0.000694785,
"loss": 1.9701652526855469,
"step": 46320
},
{
"epoch": 3.4e-05,
"grad_norm": 0.06701400130987167,
"learning_rate": 0.000695085,
"loss": 1.957753562927246,
"step": 46340
},
{
"epoch": 3.6e-05,
"grad_norm": 0.07226961851119995,
"learning_rate": 0.000695385,
"loss": 1.9627220153808593,
"step": 46360
},
{
"epoch": 3.8e-05,
"grad_norm": 0.07805868238210678,
"learning_rate": 0.000695685,
"loss": 1.9605262756347657,
"step": 46380
},
{
"epoch": 4e-05,
"grad_norm": 0.07272197306156158,
"learning_rate": 0.000695985,
"loss": 1.9611610412597655,
"step": 46400
},
{
"epoch": 4.2e-05,
"grad_norm": 0.06122796609997749,
"learning_rate": 0.000696285,
"loss": 1.947123146057129,
"step": 46420
},
{
"epoch": 4.4e-05,
"grad_norm": 0.08275068551301956,
"learning_rate": 0.000696585,
"loss": 1.9539257049560548,
"step": 46440
},
{
"epoch": 4.6e-05,
"grad_norm": 0.0847841426730156,
"learning_rate": 0.0006968850000000001,
"loss": 1.9514825820922852,
"step": 46460
},
{
"epoch": 4.8e-05,
"grad_norm": 0.05611637979745865,
"learning_rate": 0.000697185,
"loss": 1.948338508605957,
"step": 46480
},
{
"epoch": 5e-05,
"grad_norm": 0.06900504976511002,
"learning_rate": 0.0006974850000000001,
"loss": 1.9451566696166993,
"step": 46500
},
{
"epoch": 5.2e-05,
"grad_norm": 0.07195140421390533,
"learning_rate": 0.000697785,
"loss": 1.9498029708862306,
"step": 46520
},
{
"epoch": 5.4e-05,
"grad_norm": 0.07324763387441635,
"learning_rate": 0.0006980850000000001,
"loss": 1.9459251403808593,
"step": 46540
},
{
"epoch": 5.6e-05,
"grad_norm": 0.056651510298252106,
"learning_rate": 0.000698385,
"loss": 1.9457489013671876,
"step": 46560
},
{
"epoch": 5.8e-05,
"grad_norm": 0.08276001363992691,
"learning_rate": 0.000698685,
"loss": 1.9360223770141602,
"step": 46580
},
{
"epoch": 6e-05,
"grad_norm": 0.08096142113208771,
"learning_rate": 0.0006989850000000001,
"loss": 1.9375598907470704,
"step": 46600
},
{
"epoch": 6.2e-05,
"grad_norm": 0.0721917450428009,
"learning_rate": 0.000699285,
"loss": 1.9336822509765625,
"step": 46620
},
{
"epoch": 6.4e-05,
"grad_norm": 0.0872625857591629,
"learning_rate": 0.0006995850000000001,
"loss": 1.9410781860351562,
"step": 46640
},
{
"epoch": 6.6e-05,
"grad_norm": 0.05740909278392792,
"learning_rate": 0.000699885,
"loss": 1.9338249206542968,
"step": 46660
},
{
"epoch": 6.8e-05,
"grad_norm": 0.06273666769266129,
"learning_rate": 0.000700185,
"loss": 1.9296646118164062,
"step": 46680
},
{
"epoch": 7e-05,
"grad_norm": 0.07139860838651657,
"learning_rate": 0.000700485,
"loss": 1.941641616821289,
"step": 46700
},
{
"epoch": 7.2e-05,
"grad_norm": 0.07698002457618713,
"learning_rate": 0.000700785,
"loss": 1.9317914962768554,
"step": 46720
},
{
"epoch": 7.4e-05,
"grad_norm": 0.062162358313798904,
"learning_rate": 0.0007010850000000001,
"loss": 1.9283344268798828,
"step": 46740
},
{
"epoch": 7.6e-05,
"grad_norm": 0.0760132372379303,
"learning_rate": 0.000701385,
"loss": 1.9273748397827148,
"step": 46760
},
{
"epoch": 7.8e-05,
"grad_norm": 0.09244687855243683,
"learning_rate": 0.000701685,
"loss": 1.9315763473510743,
"step": 46780
},
{
"epoch": 8e-05,
"grad_norm": 0.06585084646940231,
"learning_rate": 0.000701985,
"loss": 1.9171140670776368,
"step": 46800
},
{
"epoch": 8.2e-05,
"grad_norm": 0.07399197667837143,
"learning_rate": 0.000702285,
"loss": 1.9259872436523438,
"step": 46820
},
{
"epoch": 8.4e-05,
"grad_norm": 0.0975058525800705,
"learning_rate": 0.0007025849999999999,
"loss": 1.9262987136840821,
"step": 46840
},
{
"epoch": 8.6e-05,
"grad_norm": 0.062050431966781616,
"learning_rate": 0.000702885,
"loss": 1.9207113265991211,
"step": 46860
},
{
"epoch": 8.8e-05,
"grad_norm": 0.06593676656484604,
"learning_rate": 0.0007031849999999999,
"loss": 1.9189161300659179,
"step": 46880
},
{
"epoch": 9e-05,
"grad_norm": 0.0780588909983635,
"learning_rate": 0.000703485,
"loss": 1.9223506927490235,
"step": 46900
},
{
"epoch": 9.2e-05,
"grad_norm": 0.06823083758354187,
"learning_rate": 0.000703785,
"loss": 1.912630844116211,
"step": 46920
},
{
"epoch": 9.4e-05,
"grad_norm": 0.08263996988534927,
"learning_rate": 0.000704085,
"loss": 1.9180915832519532,
"step": 46940
},
{
"epoch": 9.6e-05,
"grad_norm": 0.06720611453056335,
"learning_rate": 0.000704385,
"loss": 1.9188003540039062,
"step": 46960
},
{
"epoch": 9.8e-05,
"grad_norm": 0.09634207934141159,
"learning_rate": 0.000704685,
"loss": 1.9179636001586915,
"step": 46980
},
{
"epoch": 0.0001,
"grad_norm": 0.1031593307852745,
"learning_rate": 0.0007049850000000001,
"loss": 1.9118635177612304,
"step": 47000
},
{
"epoch": 0.0001,
"eval_loss": 1.8519573211669922,
"eval_runtime": 103.0547,
"eval_samples_per_second": 9.704,
"eval_steps_per_second": 9.704,
"step": 47000
},
{
"epoch": 0.000102,
"grad_norm": 0.06469423323869705,
"learning_rate": 0.000705285,
"loss": 1.9127388000488281,
"step": 47020
},
{
"epoch": 0.000104,
"grad_norm": 0.0648200586438179,
"learning_rate": 0.000705585,
"loss": 1.9220613479614257,
"step": 47040
},
{
"epoch": 0.000106,
"grad_norm": 0.08908385783433914,
"learning_rate": 0.0007058850000000001,
"loss": 1.9115385055541991,
"step": 47060
},
{
"epoch": 0.000108,
"grad_norm": 0.0783170759677887,
"learning_rate": 0.000706185,
"loss": 1.9148534774780273,
"step": 47080
},
{
"epoch": 0.00011,
"grad_norm": 0.08982904255390167,
"learning_rate": 0.0007064850000000001,
"loss": 1.9030448913574218,
"step": 47100
},
{
"epoch": 0.000112,
"grad_norm": 0.0841226652264595,
"learning_rate": 0.000706785,
"loss": 1.912649154663086,
"step": 47120
},
{
"epoch": 0.000114,
"grad_norm": 0.08642134070396423,
"learning_rate": 0.000707085,
"loss": 1.9114418029785156,
"step": 47140
},
{
"epoch": 0.000116,
"grad_norm": 0.06373965740203857,
"learning_rate": 0.000707385,
"loss": 1.9125936508178711,
"step": 47160
},
{
"epoch": 0.000118,
"grad_norm": 0.07079387456178665,
"learning_rate": 0.000707685,
"loss": 1.9213525772094726,
"step": 47180
},
{
"epoch": 0.00012,
"grad_norm": 0.07068858295679092,
"learning_rate": 0.0007079850000000001,
"loss": 1.9196317672729493,
"step": 47200
},
{
"epoch": 0.000122,
"grad_norm": 0.0658358484506607,
"learning_rate": 0.000708285,
"loss": 1.928008460998535,
"step": 47220
},
{
"epoch": 0.000124,
"grad_norm": 0.07867607474327087,
"learning_rate": 0.000708585,
"loss": 1.9092967987060547,
"step": 47240
},
{
"epoch": 0.000126,
"grad_norm": 0.0598660483956337,
"learning_rate": 0.000708885,
"loss": 1.914600944519043,
"step": 47260
},
{
"epoch": 0.000128,
"grad_norm": 0.06065090373158455,
"learning_rate": 0.000709185,
"loss": 1.9233844757080079,
"step": 47280
},
{
"epoch": 0.00013,
"grad_norm": 0.09242924302816391,
"learning_rate": 0.000709485,
"loss": 1.9209175109863281,
"step": 47300
},
{
"epoch": 0.000132,
"grad_norm": 0.06336706876754761,
"learning_rate": 0.000709785,
"loss": 1.9172807693481446,
"step": 47320
},
{
"epoch": 0.000134,
"grad_norm": 0.06539217382669449,
"learning_rate": 0.000710085,
"loss": 1.921341896057129,
"step": 47340
},
{
"epoch": 0.000136,
"grad_norm": 0.06496850401163101,
"learning_rate": 0.000710385,
"loss": 1.9217124938964845,
"step": 47360
},
{
"epoch": 0.000138,
"grad_norm": 0.06589950621128082,
"learning_rate": 0.000710685,
"loss": 1.917654037475586,
"step": 47380
},
{
"epoch": 0.00014,
"grad_norm": 0.10992733389139175,
"learning_rate": 0.000710985,
"loss": 1.909129524230957,
"step": 47400
},
{
"epoch": 0.000142,
"grad_norm": 0.07374437898397446,
"learning_rate": 0.000711285,
"loss": 1.9101346969604491,
"step": 47420
},
{
"epoch": 0.000144,
"grad_norm": 0.062163710594177246,
"learning_rate": 0.0007115849999999999,
"loss": 1.9079486846923828,
"step": 47440
},
{
"epoch": 0.000146,
"grad_norm": 0.08394552022218704,
"learning_rate": 0.000711885,
"loss": 1.9161951065063476,
"step": 47460
},
{
"epoch": 0.000148,
"grad_norm": 0.11592655628919601,
"learning_rate": 0.000712185,
"loss": 1.9125499725341797,
"step": 47480
},
{
"epoch": 0.00015,
"grad_norm": 0.07041492313146591,
"learning_rate": 0.000712485,
"loss": 1.9119735717773438,
"step": 47500
},
{
"epoch": 0.000152,
"grad_norm": 0.05417707934975624,
"learning_rate": 0.0007127850000000001,
"loss": 1.9030326843261718,
"step": 47520
},
{
"epoch": 0.000154,
"grad_norm": 0.0702233612537384,
"learning_rate": 0.000713085,
"loss": 1.9038074493408204,
"step": 47540
},
{
"epoch": 0.000156,
"grad_norm": 0.05859832465648651,
"learning_rate": 0.0007133850000000001,
"loss": 1.900547981262207,
"step": 47560
},
{
"epoch": 0.000158,
"grad_norm": 0.08888107538223267,
"learning_rate": 0.000713685,
"loss": 1.9098312377929687,
"step": 47580
},
{
"epoch": 0.00016,
"grad_norm": 0.0922444686293602,
"learning_rate": 0.0007139850000000001,
"loss": 1.902810287475586,
"step": 47600
},
{
"epoch": 0.000162,
"grad_norm": 0.06493257731199265,
"learning_rate": 0.000714285,
"loss": 1.9034292221069335,
"step": 47620
},
{
"epoch": 0.000164,
"grad_norm": 0.07373186200857162,
"learning_rate": 0.000714585,
"loss": 1.9035234451293945,
"step": 47640
},
{
"epoch": 0.000166,
"grad_norm": 0.06822580099105835,
"learning_rate": 0.0007148850000000001,
"loss": 1.902390480041504,
"step": 47660
},
{
"epoch": 0.000168,
"grad_norm": 0.06901398301124573,
"learning_rate": 0.000715185,
"loss": 1.89398136138916,
"step": 47680
},
{
"epoch": 0.00017,
"grad_norm": 0.09062466770410538,
"learning_rate": 0.0007154850000000001,
"loss": 1.9004844665527343,
"step": 47700
},
{
"epoch": 0.000172,
"grad_norm": 0.14246119558811188,
"learning_rate": 0.000715785,
"loss": 1.8940235137939454,
"step": 47720
},
{
"epoch": 0.000174,
"grad_norm": 0.09346599876880646,
"learning_rate": 0.000716085,
"loss": 1.8926639556884766,
"step": 47740
},
{
"epoch": 0.000176,
"grad_norm": 0.07609276473522186,
"learning_rate": 0.000716385,
"loss": 1.8961585998535155,
"step": 47760
},
{
"epoch": 0.000178,
"grad_norm": 0.06778562813997269,
"learning_rate": 0.000716685,
"loss": 1.8936416625976562,
"step": 47780
},
{
"epoch": 0.00018,
"grad_norm": 0.12500469386577606,
"learning_rate": 0.0007169850000000001,
"loss": 1.8971038818359376,
"step": 47800
},
{
"epoch": 0.000182,
"grad_norm": 0.0834629014134407,
"learning_rate": 0.000717285,
"loss": 1.9050609588623046,
"step": 47820
},
{
"epoch": 0.000184,
"grad_norm": 0.07134594768285751,
"learning_rate": 0.000717585,
"loss": 1.894935417175293,
"step": 47840
},
{
"epoch": 0.000186,
"grad_norm": 0.06053246557712555,
"learning_rate": 0.000717885,
"loss": 1.8934173583984375,
"step": 47860
},
{
"epoch": 0.000188,
"grad_norm": 0.07200822979211807,
"learning_rate": 0.000718185,
"loss": 1.895335578918457,
"step": 47880
},
{
"epoch": 0.00019,
"grad_norm": 0.07255461066961288,
"learning_rate": 0.000718485,
"loss": 1.8858306884765625,
"step": 47900
},
{
"epoch": 0.000192,
"grad_norm": 0.1142456904053688,
"learning_rate": 0.000718785,
"loss": 1.8956653594970703,
"step": 47920
},
{
"epoch": 0.000194,
"grad_norm": 0.11873633414506912,
"learning_rate": 0.000719085,
"loss": 1.8932693481445313,
"step": 47940
},
{
"epoch": 0.000196,
"grad_norm": 0.06071966513991356,
"learning_rate": 0.000719385,
"loss": 1.8919456481933594,
"step": 47960
},
{
"epoch": 0.000198,
"grad_norm": 0.10144706070423126,
"learning_rate": 0.000719685,
"loss": 1.886199951171875,
"step": 47980
},
{
"epoch": 0.0002,
"grad_norm": 0.07306289672851562,
"learning_rate": 0.000719985,
"loss": 1.886566734313965,
"step": 48000
},
{
"epoch": 0.0002,
"eval_loss": 1.8350651264190674,
"eval_runtime": 99.0695,
"eval_samples_per_second": 10.094,
"eval_steps_per_second": 10.094,
"step": 48000
},
{
"epoch": 0.000202,
"grad_norm": 0.07433490455150604,
"learning_rate": 0.000720285,
"loss": 1.8901538848876953,
"step": 48020
},
{
"epoch": 0.000204,
"grad_norm": 0.06506136059761047,
"learning_rate": 0.000720585,
"loss": 1.8856683731079102,
"step": 48040
},
{
"epoch": 0.000206,
"grad_norm": 0.07532741129398346,
"learning_rate": 0.000720885,
"loss": 1.885334587097168,
"step": 48060
},
{
"epoch": 0.000208,
"grad_norm": 0.08687019348144531,
"learning_rate": 0.0007211850000000001,
"loss": 1.8871675491333009,
"step": 48080
},
{
"epoch": 0.00021,
"grad_norm": 0.06796624511480331,
"learning_rate": 0.000721485,
"loss": 1.88447265625,
"step": 48100
},
{
"epoch": 0.000212,
"grad_norm": 0.07211881875991821,
"learning_rate": 0.0007217850000000001,
"loss": 1.8851350784301757,
"step": 48120
},
{
"epoch": 0.000214,
"grad_norm": 0.09619178622961044,
"learning_rate": 0.000722085,
"loss": 1.8860481262207032,
"step": 48140
},
{
"epoch": 0.000216,
"grad_norm": 0.09473865479230881,
"learning_rate": 0.0007223850000000001,
"loss": 1.8759679794311523,
"step": 48160
},
{
"epoch": 0.000218,
"grad_norm": 0.06743013858795166,
"learning_rate": 0.000722685,
"loss": 1.8819561004638672,
"step": 48180
},
{
"epoch": 0.00022,
"grad_norm": 0.08684151619672775,
"learning_rate": 0.000722985,
"loss": 1.877330207824707,
"step": 48200
},
{
"epoch": 0.000222,
"grad_norm": 0.06397704780101776,
"learning_rate": 0.000723285,
"loss": 1.8899486541748047,
"step": 48220
},
{
"epoch": 0.000224,
"grad_norm": 0.0900849923491478,
"learning_rate": 0.000723585,
"loss": 1.8874429702758788,
"step": 48240
},
{
"epoch": 0.000226,
"grad_norm": 0.07488174736499786,
"learning_rate": 0.0007238850000000001,
"loss": 1.8861740112304688,
"step": 48260
},
{
"epoch": 0.000228,
"grad_norm": 0.09316900372505188,
"learning_rate": 0.000724185,
"loss": 1.8858060836791992,
"step": 48280
},
{
"epoch": 0.00023,
"grad_norm": 0.0723276361823082,
"learning_rate": 0.000724485,
"loss": 1.8740653991699219,
"step": 48300
},
{
"epoch": 0.000232,
"grad_norm": 0.0841292217373848,
"learning_rate": 0.000724785,
"loss": 1.8807933807373047,
"step": 48320
},
{
"epoch": 0.000234,
"grad_norm": 0.09044871479272842,
"learning_rate": 0.000725085,
"loss": 1.8928699493408203,
"step": 48340
},
{
"epoch": 0.000236,
"grad_norm": 0.08968909084796906,
"learning_rate": 0.000725385,
"loss": 1.8885452270507812,
"step": 48360
},
{
"epoch": 0.000238,
"grad_norm": 0.07492511719465256,
"learning_rate": 0.000725685,
"loss": 1.881599235534668,
"step": 48380
},
{
"epoch": 0.00024,
"grad_norm": 0.06670362502336502,
"learning_rate": 0.000725985,
"loss": 1.886728858947754,
"step": 48400
},
{
"epoch": 0.000242,
"grad_norm": 0.06100883707404137,
"learning_rate": 0.000726285,
"loss": 1.898359489440918,
"step": 48420
},
{
"epoch": 0.000244,
"grad_norm": 0.07540082186460495,
"learning_rate": 0.000726585,
"loss": 1.8863595962524413,
"step": 48440
},
{
"epoch": 0.000246,
"grad_norm": 0.06365904211997986,
"learning_rate": 0.000726885,
"loss": 1.8902715682983398,
"step": 48460
},
{
"epoch": 0.000248,
"grad_norm": 0.07440081238746643,
"learning_rate": 0.000727185,
"loss": 1.8887521743774414,
"step": 48480
},
{
"epoch": 0.00025,
"grad_norm": 0.06741853058338165,
"learning_rate": 0.0007274849999999999,
"loss": 1.8897829055786133,
"step": 48500
},
{
"epoch": 0.000252,
"grad_norm": 0.06400787085294724,
"learning_rate": 0.000727785,
"loss": 1.892916488647461,
"step": 48520
},
{
"epoch": 0.000254,
"grad_norm": 0.084056057035923,
"learning_rate": 0.000728085,
"loss": 1.8810224533081055,
"step": 48540
},
{
"epoch": 0.000256,
"grad_norm": 0.07808465510606766,
"learning_rate": 0.000728385,
"loss": 1.8811614990234375,
"step": 48560
},
{
"epoch": 0.000258,
"grad_norm": 0.06912193447351456,
"learning_rate": 0.000728685,
"loss": 1.8807933807373047,
"step": 48580
},
{
"epoch": 0.00026,
"grad_norm": 0.11728200316429138,
"learning_rate": 0.000728985,
"loss": 1.8793157577514648,
"step": 48600
},
{
"epoch": 0.000262,
"grad_norm": 0.07116056978702545,
"learning_rate": 0.000729285,
"loss": 1.8806476593017578,
"step": 48620
},
{
"epoch": 0.000264,
"grad_norm": 0.07659170776605606,
"learning_rate": 0.000729585,
"loss": 1.8804895401000976,
"step": 48640
},
{
"epoch": 0.000266,
"grad_norm": 0.05822935327887535,
"learning_rate": 0.000729885,
"loss": 1.8786319732666015,
"step": 48660
},
{
"epoch": 0.000268,
"grad_norm": 0.07382626831531525,
"learning_rate": 0.0007301850000000001,
"loss": 1.8767101287841796,
"step": 48680
},
{
"epoch": 0.00027,
"grad_norm": 0.07334620505571365,
"learning_rate": 0.000730485,
"loss": 1.8743818283081055,
"step": 48700
},
{
"epoch": 0.000272,
"grad_norm": 0.07567453384399414,
"learning_rate": 0.0007307850000000001,
"loss": 1.8763639450073242,
"step": 48720
},
{
"epoch": 0.000274,
"grad_norm": 0.08777511864900589,
"learning_rate": 0.000731085,
"loss": 1.8786584854125976,
"step": 48740
},
{
"epoch": 0.000276,
"grad_norm": 0.09745394438505173,
"learning_rate": 0.0007313850000000001,
"loss": 1.8746225357055664,
"step": 48760
},
{
"epoch": 0.000278,
"grad_norm": 0.06679695099592209,
"learning_rate": 0.000731685,
"loss": 1.8859651565551758,
"step": 48780
},
{
"epoch": 0.00028,
"grad_norm": 0.054582711309194565,
"learning_rate": 0.000731985,
"loss": 1.8781494140625,
"step": 48800
},
{
"epoch": 0.000282,
"grad_norm": 0.06270311772823334,
"learning_rate": 0.000732285,
"loss": 1.8780647277832032,
"step": 48820
},
{
"epoch": 0.000284,
"grad_norm": 0.07959431409835815,
"learning_rate": 0.000732585,
"loss": 1.872858428955078,
"step": 48840
},
{
"epoch": 0.000286,
"grad_norm": 0.08098466694355011,
"learning_rate": 0.0007328850000000001,
"loss": 1.8745456695556642,
"step": 48860
},
{
"epoch": 0.000288,
"grad_norm": 0.0944877415895462,
"learning_rate": 0.000733185,
"loss": 1.8757490158081054,
"step": 48880
},
{
"epoch": 0.00029,
"grad_norm": 0.09513352811336517,
"learning_rate": 0.000733485,
"loss": 1.886286735534668,
"step": 48900
},
{
"epoch": 0.000292,
"grad_norm": 0.10484618693590164,
"learning_rate": 0.000733785,
"loss": 1.8716920852661132,
"step": 48920
},
{
"epoch": 0.000294,
"grad_norm": 0.06396955996751785,
"learning_rate": 0.000734085,
"loss": 1.876509666442871,
"step": 48940
},
{
"epoch": 0.000296,
"grad_norm": 0.06441602110862732,
"learning_rate": 0.000734385,
"loss": 1.8659820556640625,
"step": 48960
},
{
"epoch": 0.000298,
"grad_norm": 0.08893131464719772,
"learning_rate": 0.000734685,
"loss": 1.865779495239258,
"step": 48980
},
{
"epoch": 0.0003,
"grad_norm": 0.07854273170232773,
"learning_rate": 0.000734985,
"loss": 1.8671316146850585,
"step": 49000
},
{
"epoch": 0.0003,
"eval_loss": 1.8231958150863647,
"eval_runtime": 99.9569,
"eval_samples_per_second": 10.004,
"eval_steps_per_second": 10.004,
"step": 49000
},
{
"epoch": 0.000302,
"grad_norm": 0.08891486376523972,
"learning_rate": 0.000735285,
"loss": 1.8616506576538085,
"step": 49020
},
{
"epoch": 0.000304,
"grad_norm": 0.08781826496124268,
"learning_rate": 0.000735585,
"loss": 1.865854835510254,
"step": 49040
},
{
"epoch": 0.000306,
"grad_norm": 0.12502416968345642,
"learning_rate": 0.000735885,
"loss": 1.8626695632934571,
"step": 49060
},
{
"epoch": 0.000308,
"grad_norm": 0.06342129409313202,
"learning_rate": 0.000736185,
"loss": 1.8653135299682617,
"step": 49080
},
{
"epoch": 0.00031,
"grad_norm": 0.08215075731277466,
"learning_rate": 0.0007364849999999999,
"loss": 1.8684637069702148,
"step": 49100
},
{
"epoch": 0.000312,
"grad_norm": 0.09643544256687164,
"learning_rate": 0.000736785,
"loss": 1.8758543014526368,
"step": 49120
},
{
"epoch": 0.000314,
"grad_norm": 0.08002220094203949,
"learning_rate": 0.000737085,
"loss": 1.8670568466186523,
"step": 49140
},
{
"epoch": 0.000316,
"grad_norm": 0.05769426375627518,
"learning_rate": 0.000737385,
"loss": 1.8668659210205079,
"step": 49160
},
{
"epoch": 0.000318,
"grad_norm": 0.09401297569274902,
"learning_rate": 0.0007376850000000001,
"loss": 1.8710269927978516,
"step": 49180
},
{
"epoch": 0.00032,
"grad_norm": 0.1117960587143898,
"learning_rate": 0.000737985,
"loss": 1.870610237121582,
"step": 49200
},
{
"epoch": 0.000322,
"grad_norm": 0.08143491297960281,
"learning_rate": 0.0007382850000000001,
"loss": 1.866176223754883,
"step": 49220
},
{
"epoch": 0.000324,
"grad_norm": 0.0771065503358841,
"learning_rate": 0.000738585,
"loss": 1.867238426208496,
"step": 49240
},
{
"epoch": 0.000326,
"grad_norm": 0.04945933073759079,
"learning_rate": 0.000738885,
"loss": 1.8657207489013672,
"step": 49260
},
{
"epoch": 0.000328,
"grad_norm": 0.08263809978961945,
"learning_rate": 0.0007391850000000001,
"loss": 1.8570655822753905,
"step": 49280
},
{
"epoch": 0.00033,
"grad_norm": 0.0943840742111206,
"learning_rate": 0.000739485,
"loss": 1.8613241195678711,
"step": 49300
},
{
"epoch": 0.000332,
"grad_norm": 0.06208841875195503,
"learning_rate": 0.0007397850000000001,
"loss": 1.8662214279174805,
"step": 49320
},
{
"epoch": 0.000334,
"grad_norm": 0.06485865265130997,
"learning_rate": 0.000740085,
"loss": 1.8635101318359375,
"step": 49340
},
{
"epoch": 0.000336,
"grad_norm": 0.08560191094875336,
"learning_rate": 0.000740385,
"loss": 1.8564205169677734,
"step": 49360
},
{
"epoch": 0.000338,
"grad_norm": 0.12357484549283981,
"learning_rate": 0.000740685,
"loss": 1.8634933471679687,
"step": 49380
},
{
"epoch": 0.00034,
"grad_norm": 0.08451298624277115,
"learning_rate": 0.000740985,
"loss": 1.8603437423706055,
"step": 49400
},
{
"epoch": 0.000342,
"grad_norm": 0.09098716825246811,
"learning_rate": 0.0007412850000000001,
"loss": 1.8705177307128906,
"step": 49420
},
{
"epoch": 0.000344,
"grad_norm": 0.0718744546175003,
"learning_rate": 0.000741585,
"loss": 1.8548259735107422,
"step": 49440
},
{
"epoch": 0.000346,
"grad_norm": 0.06135766953229904,
"learning_rate": 0.000741885,
"loss": 1.8501501083374023,
"step": 49460
},
{
"epoch": 0.000348,
"grad_norm": 0.09332036226987839,
"learning_rate": 0.000742185,
"loss": 1.8546777725219727,
"step": 49480
},
{
"epoch": 0.00035,
"grad_norm": 0.1360894739627838,
"learning_rate": 0.000742485,
"loss": 1.864227294921875,
"step": 49500
},
{
"epoch": 0.000352,
"grad_norm": 0.08547444641590118,
"learning_rate": 0.000742785,
"loss": 1.8685710906982422,
"step": 49520
},
{
"epoch": 0.000354,
"grad_norm": 0.10424457490444183,
"learning_rate": 0.000743085,
"loss": 1.8618698120117188,
"step": 49540
},
{
"epoch": 0.000356,
"grad_norm": 0.09299690276384354,
"learning_rate": 0.0007433849999999999,
"loss": 1.8716371536254883,
"step": 49560
},
{
"epoch": 0.000358,
"grad_norm": 0.06361870467662811,
"learning_rate": 0.000743685,
"loss": 1.8801010131835938,
"step": 49580
},
{
"epoch": 0.00036,
"grad_norm": 0.08042526245117188,
"learning_rate": 0.000743985,
"loss": 1.8659257888793945,
"step": 49600
},
{
"epoch": 0.000362,
"grad_norm": 0.10201700031757355,
"learning_rate": 0.000744285,
"loss": 1.8701637268066407,
"step": 49620
},
{
"epoch": 0.000364,
"grad_norm": 0.10048798471689224,
"learning_rate": 0.000744585,
"loss": 1.8687246322631836,
"step": 49640
},
{
"epoch": 0.000366,
"grad_norm": 0.10112548619508743,
"learning_rate": 0.0007448849999999999,
"loss": 1.867312240600586,
"step": 49660
},
{
"epoch": 0.000368,
"grad_norm": 0.06898175179958344,
"learning_rate": 0.000745185,
"loss": 1.8694904327392579,
"step": 49680
},
{
"epoch": 0.00037,
"grad_norm": 0.08607565611600876,
"learning_rate": 0.000745485,
"loss": 1.8709667205810547,
"step": 49700
},
{
"epoch": 0.000372,
"grad_norm": 0.08153693377971649,
"learning_rate": 0.000745785,
"loss": 1.8627836227416992,
"step": 49720
},
{
"epoch": 0.000374,
"grad_norm": 0.07933573424816132,
"learning_rate": 0.0007460850000000001,
"loss": 1.8717823028564453,
"step": 49740
},
{
"epoch": 0.000376,
"grad_norm": 0.0822339653968811,
"learning_rate": 0.000746385,
"loss": 1.8707391738891601,
"step": 49760
},
{
"epoch": 0.000378,
"grad_norm": 0.08838674426078796,
"learning_rate": 0.0007466850000000001,
"loss": 1.8709238052368165,
"step": 49780
},
{
"epoch": 0.00038,
"grad_norm": 0.09605666249990463,
"learning_rate": 0.000746985,
"loss": 1.8747797012329102,
"step": 49800
},
{
"epoch": 0.000382,
"grad_norm": 0.07646477222442627,
"learning_rate": 0.0007472850000000001,
"loss": 1.859670639038086,
"step": 49820
},
{
"epoch": 0.000384,
"grad_norm": 0.07252638041973114,
"learning_rate": 0.000747585,
"loss": 1.856839942932129,
"step": 49840
},
{
"epoch": 0.000386,
"grad_norm": 0.08199745416641235,
"learning_rate": 0.000747885,
"loss": 1.867083740234375,
"step": 49860
},
{
"epoch": 0.000388,
"grad_norm": 0.07510737329721451,
"learning_rate": 0.0007481850000000001,
"loss": 1.8708480834960937,
"step": 49880
},
{
"epoch": 0.00039,
"grad_norm": 0.10873018205165863,
"learning_rate": 0.000748485,
"loss": 1.8570371627807618,
"step": 49900
},
{
"epoch": 0.000392,
"grad_norm": 0.07855768501758575,
"learning_rate": 0.0007487850000000001,
"loss": 1.8611907958984375,
"step": 49920
},
{
"epoch": 0.000394,
"grad_norm": 0.0734357237815857,
"learning_rate": 0.000749085,
"loss": 1.8603155136108398,
"step": 49940
},
{
"epoch": 0.000396,
"grad_norm": 0.11408625543117523,
"learning_rate": 0.000749385,
"loss": 1.862259292602539,
"step": 49960
},
{
"epoch": 0.000398,
"grad_norm": 0.10029411315917969,
"learning_rate": 0.000749685,
"loss": 1.86767578125,
"step": 49980
},
{
"epoch": 0.0004,
"grad_norm": 0.07305110991001129,
"learning_rate": 0.000749985,
"loss": 1.8574264526367188,
"step": 50000
},
{
"epoch": 0.0004,
"eval_loss": 1.8127195835113525,
"eval_runtime": 104.6958,
"eval_samples_per_second": 9.551,
"eval_steps_per_second": 9.551,
"step": 50000
},
{
"epoch": 0.000402,
"grad_norm": 0.07434222847223282,
"learning_rate": 0.0007502850000000001,
"loss": 1.8548992156982422,
"step": 50020
},
{
"epoch": 0.000404,
"grad_norm": 0.10143296420574188,
"learning_rate": 0.000750585,
"loss": 1.853312110900879,
"step": 50040
},
{
"epoch": 0.000406,
"grad_norm": 0.08113838732242584,
"learning_rate": 0.000750885,
"loss": 1.8585927963256836,
"step": 50060
},
{
"epoch": 0.000408,
"grad_norm": 0.06600955873727798,
"learning_rate": 0.0007511849999999999,
"loss": 1.853336715698242,
"step": 50080
},
{
"epoch": 0.00041,
"grad_norm": 0.09208826720714569,
"learning_rate": 0.0007514850000000001,
"loss": 1.8564899444580079,
"step": 50100
},
{
"epoch": 0.000412,
"grad_norm": 0.05692492425441742,
"learning_rate": 0.000751785,
"loss": 1.8583003997802734,
"step": 50120
},
{
"epoch": 0.000414,
"grad_norm": 0.09818264096975327,
"learning_rate": 0.000752085,
"loss": 1.851161575317383,
"step": 50140
},
{
"epoch": 0.000416,
"grad_norm": 0.11614762246608734,
"learning_rate": 0.000752385,
"loss": 1.8539705276489258,
"step": 50160
},
{
"epoch": 0.000418,
"grad_norm": 0.06572745740413666,
"learning_rate": 0.0007526849999999999,
"loss": 1.862236785888672,
"step": 50180
},
{
"epoch": 0.00042,
"grad_norm": 0.08823873102664948,
"learning_rate": 0.0007529850000000001,
"loss": 1.8488019943237304,
"step": 50200
},
{
"epoch": 0.000422,
"grad_norm": 0.06876957416534424,
"learning_rate": 0.000753285,
"loss": 1.854522132873535,
"step": 50220
},
{
"epoch": 0.000424,
"grad_norm": 0.1036091297864914,
"learning_rate": 0.000753585,
"loss": 1.8490419387817383,
"step": 50240
},
{
"epoch": 0.000426,
"grad_norm": 0.08654841780662537,
"learning_rate": 0.000753885,
"loss": 1.8570022583007812,
"step": 50260
},
{
"epoch": 0.000428,
"grad_norm": 0.0797325074672699,
"learning_rate": 0.000754185,
"loss": 1.852284049987793,
"step": 50280
},
{
"epoch": 0.00043,
"grad_norm": 0.09358066320419312,
"learning_rate": 0.000754485,
"loss": 1.845249557495117,
"step": 50300
},
{
"epoch": 0.000432,
"grad_norm": 0.09743467718362808,
"learning_rate": 0.000754785,
"loss": 1.8510974884033202,
"step": 50320
},
{
"epoch": 0.000434,
"grad_norm": 0.07994414120912552,
"learning_rate": 0.0007550850000000001,
"loss": 1.8470056533813477,
"step": 50340
},
{
"epoch": 0.000436,
"grad_norm": 0.07373213022947311,
"learning_rate": 0.000755385,
"loss": 1.8472797393798828,
"step": 50360
},
{
"epoch": 0.000438,
"grad_norm": 0.07436708360910416,
"learning_rate": 0.000755685,
"loss": 1.8461109161376954,
"step": 50380
},
{
"epoch": 0.00044,
"grad_norm": 0.06742985546588898,
"learning_rate": 0.0007559850000000001,
"loss": 1.8556638717651368,
"step": 50400
},
{
"epoch": 0.000442,
"grad_norm": 0.07899279147386551,
"learning_rate": 0.0007562850000000001,
"loss": 1.8491823196411132,
"step": 50420
},
{
"epoch": 0.000444,
"grad_norm": 0.0626215934753418,
"learning_rate": 0.000756585,
"loss": 1.8468595504760743,
"step": 50440
},
{
"epoch": 0.000446,
"grad_norm": 0.07054529339075089,
"learning_rate": 0.000756885,
"loss": 1.8442632675170898,
"step": 50460
},
{
"epoch": 0.000448,
"grad_norm": 0.08473960310220718,
"learning_rate": 0.000757185,
"loss": 1.8389867782592773,
"step": 50480
},
{
"epoch": 0.00045,
"grad_norm": 0.08779094368219376,
"learning_rate": 0.0007574850000000001,
"loss": 1.847212028503418,
"step": 50500
},
{
"epoch": 0.000452,
"grad_norm": 0.06304117292165756,
"learning_rate": 0.0007577850000000001,
"loss": 1.838887596130371,
"step": 50520
},
{
"epoch": 0.000454,
"grad_norm": 0.07276386022567749,
"learning_rate": 0.000758085,
"loss": 1.8409353256225587,
"step": 50540
},
{
"epoch": 0.000456,
"grad_norm": 0.07081222534179688,
"learning_rate": 0.000758385,
"loss": 1.8434917449951171,
"step": 50560
},
{
"epoch": 0.000458,
"grad_norm": 0.09153230488300323,
"learning_rate": 0.0007586849999999999,
"loss": 1.8405410766601562,
"step": 50580
},
{
"epoch": 0.00046,
"grad_norm": 0.08038565516471863,
"learning_rate": 0.0007589850000000001,
"loss": 1.8444704055786132,
"step": 50600
},
{
"epoch": 0.000462,
"grad_norm": 0.08140019327402115,
"learning_rate": 0.0007592850000000001,
"loss": 1.8456674575805665,
"step": 50620
},
{
"epoch": 0.000464,
"grad_norm": 0.07837044447660446,
"learning_rate": 0.000759585,
"loss": 1.8389007568359375,
"step": 50640
},
{
"epoch": 0.000466,
"grad_norm": 0.08453674614429474,
"learning_rate": 0.000759885,
"loss": 1.8354032516479493,
"step": 50660
},
{
"epoch": 0.000468,
"grad_norm": 0.08782172948122025,
"learning_rate": 0.0007601849999999999,
"loss": 1.8379409790039063,
"step": 50680
},
{
"epoch": 0.00047,
"grad_norm": 0.06480462849140167,
"learning_rate": 0.0007604850000000001,
"loss": 1.8450876235961915,
"step": 50700
},
{
"epoch": 0.000472,
"grad_norm": 0.09490370750427246,
"learning_rate": 0.000760785,
"loss": 1.8424947738647461,
"step": 50720
},
{
"epoch": 0.000474,
"grad_norm": 0.09134998172521591,
"learning_rate": 0.000761085,
"loss": 1.8489044189453125,
"step": 50740
},
{
"epoch": 0.000476,
"grad_norm": 0.08516672253608704,
"learning_rate": 0.000761385,
"loss": 1.8510494232177734,
"step": 50760
},
{
"epoch": 0.000478,
"grad_norm": 0.09990148991346359,
"learning_rate": 0.000761685,
"loss": 1.8433395385742188,
"step": 50780
},
{
"epoch": 0.00048,
"grad_norm": 0.07432044297456741,
"learning_rate": 0.0007619850000000001,
"loss": 1.8616621017456054,
"step": 50800
},
{
"epoch": 0.000482,
"grad_norm": 0.07730050384998322,
"learning_rate": 0.000762285,
"loss": 1.857870101928711,
"step": 50820
},
{
"epoch": 0.000484,
"grad_norm": 0.09263300895690918,
"learning_rate": 0.000762585,
"loss": 1.852854347229004,
"step": 50840
},
{
"epoch": 0.000486,
"grad_norm": 0.1193644255399704,
"learning_rate": 0.000762885,
"loss": 1.8558570861816406,
"step": 50860
},
{
"epoch": 0.000488,
"grad_norm": 0.06789831817150116,
"learning_rate": 0.000763185,
"loss": 1.8561784744262695,
"step": 50880
},
{
"epoch": 0.00049,
"grad_norm": 0.09891850501298904,
"learning_rate": 0.000763485,
"loss": 1.8547218322753907,
"step": 50900
},
{
"epoch": 0.000492,
"grad_norm": 0.07384803146123886,
"learning_rate": 0.0007637850000000001,
"loss": 1.856735610961914,
"step": 50920
},
{
"epoch": 0.000494,
"grad_norm": 0.07126709073781967,
"learning_rate": 0.0007640850000000001,
"loss": 1.855617141723633,
"step": 50940
},
{
"epoch": 0.000496,
"grad_norm": 0.0794643834233284,
"learning_rate": 0.000764385,
"loss": 1.851529312133789,
"step": 50960
},
{
"epoch": 0.000498,
"grad_norm": 0.07430235296487808,
"learning_rate": 0.000764685,
"loss": 1.84918270111084,
"step": 50980
},
{
"epoch": 0.0005,
"grad_norm": 0.05850321426987648,
"learning_rate": 0.0007649850000000001,
"loss": 1.8446617126464844,
"step": 51000
},
{
"epoch": 0.0005,
"eval_loss": 1.8034069538116455,
"eval_runtime": 99.2653,
"eval_samples_per_second": 10.074,
"eval_steps_per_second": 10.074,
"step": 51000
}
],
"logging_steps": 20,
"max_steps": 10000000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 8.94075150532608e+18,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}