{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.32647730982696704, "eval_steps": 500, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0010882576994232234, "grad_norm": 0.5460862517356873, "learning_rate": 1.8e-05, "loss": 4.743990707397461, "step": 10 }, { "epoch": 0.0021765153988464467, "grad_norm": 0.40822282433509827, "learning_rate": 3.8e-05, "loss": 4.506277847290039, "step": 20 }, { "epoch": 0.00326477309826967, "grad_norm": 0.5533190965652466, "learning_rate": 5.8e-05, "loss": 4.476789474487305, "step": 30 }, { "epoch": 0.004353030797692893, "grad_norm": 0.5098243951797485, "learning_rate": 7.800000000000001e-05, "loss": 4.173786926269531, "step": 40 }, { "epoch": 0.005441288497116117, "grad_norm": 0.46193602681159973, "learning_rate": 9.8e-05, "loss": 3.8873260498046873, "step": 50 }, { "epoch": 0.00652954619653934, "grad_norm": 0.6326547861099243, "learning_rate": 0.000118, "loss": 3.690767288208008, "step": 60 }, { "epoch": 0.007617803895962564, "grad_norm": 0.5634731650352478, "learning_rate": 0.000138, "loss": 3.532633590698242, "step": 70 }, { "epoch": 0.008706061595385787, "grad_norm": 0.7146243453025818, "learning_rate": 0.00015800000000000002, "loss": 3.369486999511719, "step": 80 }, { "epoch": 0.009794319294809012, "grad_norm": 0.7313923239707947, "learning_rate": 0.00017800000000000002, "loss": 3.3079143524169923, "step": 90 }, { "epoch": 0.010882576994232234, "grad_norm": 0.8027234077453613, "learning_rate": 0.00019800000000000002, "loss": 3.2139404296875, "step": 100 }, { "epoch": 0.011970834693655457, "grad_norm": 0.7909902930259705, "learning_rate": 0.00019999951613722537, "loss": 3.099309539794922, "step": 110 }, { "epoch": 0.01305909239307868, "grad_norm": 0.8192159533500671, "learning_rate": 0.00019999784353117638, "loss": 3.0375497817993162, "step": 120 }, { "epoch": 0.014147350092501905, "grad_norm": 0.7443103790283203, "learning_rate": 0.0001999949762282168, "loss": 2.978965950012207, "step": 130 }, { "epoch": 0.015235607791925128, "grad_norm": 0.7991694808006287, "learning_rate": 0.000199990914262603, "loss": 2.9791082382202148, "step": 140 }, { "epoch": 0.01632386549134835, "grad_norm": 0.6008569002151489, "learning_rate": 0.00019998565768286416, "loss": 2.950560188293457, "step": 150 }, { "epoch": 0.017412123190771574, "grad_norm": 0.7995827794075012, "learning_rate": 0.00019997920655180184, "loss": 3.0215282440185547, "step": 160 }, { "epoch": 0.018500380890194797, "grad_norm": 0.7619604468345642, "learning_rate": 0.00019997156094648917, "loss": 2.7942909240722655, "step": 170 }, { "epoch": 0.019588638589618023, "grad_norm": 0.7879506349563599, "learning_rate": 0.0001999627209582699, "loss": 2.9927343368530273, "step": 180 }, { "epoch": 0.020676896289041246, "grad_norm": 0.6188663840293884, "learning_rate": 0.0001999526866927574, "loss": 2.996811866760254, "step": 190 }, { "epoch": 0.02176515398846447, "grad_norm": 0.8291100263595581, "learning_rate": 0.00019994145826983335, "loss": 2.8538694381713867, "step": 200 }, { "epoch": 0.022853411687887692, "grad_norm": 0.7064241766929626, "learning_rate": 0.00019992903582364616, "loss": 2.9169912338256836, "step": 210 }, { "epoch": 0.023941669387310915, "grad_norm": 0.7565109133720398, "learning_rate": 0.00019991541950260976, "loss": 2.8318023681640625, "step": 220 }, { "epoch": 0.025029927086734138, "grad_norm": 0.8033138513565063, "learning_rate": 0.00019990060946940128, "loss": 2.9133060455322264, "step": 230 }, { "epoch": 0.02611818478615736, "grad_norm": 0.6850875020027161, "learning_rate": 0.00019988460590095964, "loss": 2.8186214447021483, "step": 240 }, { "epoch": 0.027206442485580587, "grad_norm": 0.822592556476593, "learning_rate": 0.00019986740898848306, "loss": 2.751984214782715, "step": 250 }, { "epoch": 0.02829470018500381, "grad_norm": 0.7135462164878845, "learning_rate": 0.00019984901893742695, "loss": 2.845341682434082, "step": 260 }, { "epoch": 0.029382957884427033, "grad_norm": 0.7428542971611023, "learning_rate": 0.00019982943596750147, "loss": 2.760402488708496, "step": 270 }, { "epoch": 0.030471215583850256, "grad_norm": 0.6774494051933289, "learning_rate": 0.00019980866031266871, "loss": 2.7369028091430665, "step": 280 }, { "epoch": 0.03155947328327348, "grad_norm": 0.5907191038131714, "learning_rate": 0.00019978669222114022, "loss": 2.6875715255737305, "step": 290 }, { "epoch": 0.0326477309826967, "grad_norm": 0.604983925819397, "learning_rate": 0.00019976353195537373, "loss": 2.7130207061767577, "step": 300 }, { "epoch": 0.033735988682119925, "grad_norm": 0.6687904596328735, "learning_rate": 0.0001997391797920702, "loss": 2.6797380447387695, "step": 310 }, { "epoch": 0.03482424638154315, "grad_norm": 0.7419909834861755, "learning_rate": 0.00019971363602217039, "loss": 2.7096893310546877, "step": 320 }, { "epoch": 0.03591250408096637, "grad_norm": 0.7090854644775391, "learning_rate": 0.0001996869009508516, "loss": 2.635569953918457, "step": 330 }, { "epoch": 0.03700076178038959, "grad_norm": 0.7182894945144653, "learning_rate": 0.00019965897489752373, "loss": 2.6656593322753905, "step": 340 }, { "epoch": 0.038089019479812816, "grad_norm": 0.7110818028450012, "learning_rate": 0.0001996298581958257, "loss": 2.6308521270751952, "step": 350 }, { "epoch": 0.039177277179236046, "grad_norm": 0.5732347965240479, "learning_rate": 0.00019959955119362133, "loss": 2.6709070205688477, "step": 360 }, { "epoch": 0.04026553487865927, "grad_norm": 0.6702016592025757, "learning_rate": 0.00019956805425299526, "loss": 2.531391906738281, "step": 370 }, { "epoch": 0.04135379257808249, "grad_norm": 0.6591757535934448, "learning_rate": 0.00019953536775024855, "loss": 2.5455032348632813, "step": 380 }, { "epoch": 0.042442050277505715, "grad_norm": 0.5890617966651917, "learning_rate": 0.0001995014920758943, "loss": 2.5943485260009767, "step": 390 }, { "epoch": 0.04353030797692894, "grad_norm": 0.597907304763794, "learning_rate": 0.00019946642763465287, "loss": 2.5355979919433596, "step": 400 }, { "epoch": 0.04461856567635216, "grad_norm": 0.5858283638954163, "learning_rate": 0.00019943017484544705, "loss": 2.5751579284667967, "step": 410 }, { "epoch": 0.045706823375775384, "grad_norm": 0.6279524564743042, "learning_rate": 0.00019939273414139717, "loss": 2.5788373947143555, "step": 420 }, { "epoch": 0.04679508107519861, "grad_norm": 0.6761276721954346, "learning_rate": 0.0001993541059698158, "loss": 2.638111686706543, "step": 430 }, { "epoch": 0.04788333877462183, "grad_norm": 0.7934256196022034, "learning_rate": 0.00019931429079220246, "loss": 2.597989082336426, "step": 440 }, { "epoch": 0.04897159647404505, "grad_norm": 0.614450216293335, "learning_rate": 0.0001992732890842381, "loss": 2.6165655136108397, "step": 450 }, { "epoch": 0.050059854173468275, "grad_norm": 0.6322848796844482, "learning_rate": 0.00019923110133577944, "loss": 2.618748664855957, "step": 460 }, { "epoch": 0.0511481118728915, "grad_norm": 0.7874864339828491, "learning_rate": 0.0001991877280508531, "loss": 2.5130441665649412, "step": 470 }, { "epoch": 0.05223636957231472, "grad_norm": 0.6739583611488342, "learning_rate": 0.0001991431697476495, "loss": 2.512283134460449, "step": 480 }, { "epoch": 0.053324627271737944, "grad_norm": 0.6174733638763428, "learning_rate": 0.00019909742695851677, "loss": 2.513458824157715, "step": 490 }, { "epoch": 0.054412884971161174, "grad_norm": 0.7092267274856567, "learning_rate": 0.00019905050022995445, "loss": 2.504042053222656, "step": 500 }, { "epoch": 0.054412884971161174, "eval_loss": 2.5402708053588867, "eval_runtime": 586.9756, "eval_samples_per_second": 52.731, "eval_steps_per_second": 1.649, "step": 500 }, { "epoch": 0.0555011426705844, "grad_norm": 0.6926353573799133, "learning_rate": 0.00019900239012260676, "loss": 2.526125907897949, "step": 510 }, { "epoch": 0.05658940037000762, "grad_norm": 0.677131175994873, "learning_rate": 0.0001989530972112561, "loss": 2.5419589996337892, "step": 520 }, { "epoch": 0.05767765806943084, "grad_norm": 0.6061253547668457, "learning_rate": 0.00019890262208481607, "loss": 2.4368318557739257, "step": 530 }, { "epoch": 0.058765915768854066, "grad_norm": 0.759306013584137, "learning_rate": 0.00019885096534632437, "loss": 2.5052522659301757, "step": 540 }, { "epoch": 0.05985417346827729, "grad_norm": 0.6426571011543274, "learning_rate": 0.00019879812761293585, "loss": 2.500101089477539, "step": 550 }, { "epoch": 0.06094243116770051, "grad_norm": 0.6019865274429321, "learning_rate": 0.00019874410951591483, "loss": 2.5190673828125, "step": 560 }, { "epoch": 0.062030688867123734, "grad_norm": 0.6041361093521118, "learning_rate": 0.0001986889117006278, "loss": 2.441026496887207, "step": 570 }, { "epoch": 0.06311894656654696, "grad_norm": 0.5995342135429382, "learning_rate": 0.0001986325348265356, "loss": 2.5326648712158204, "step": 580 }, { "epoch": 0.06420720426597018, "grad_norm": 0.6185106039047241, "learning_rate": 0.00019857497956718545, "loss": 2.556035041809082, "step": 590 }, { "epoch": 0.0652954619653934, "grad_norm": 0.5220043659210205, "learning_rate": 0.00019851624661020316, "loss": 2.4316898345947267, "step": 600 }, { "epoch": 0.06638371966481663, "grad_norm": 0.6268026828765869, "learning_rate": 0.00019845633665728464, "loss": 2.5950042724609377, "step": 610 }, { "epoch": 0.06747197736423985, "grad_norm": 0.6248210072517395, "learning_rate": 0.00019839525042418768, "loss": 2.441714859008789, "step": 620 }, { "epoch": 0.06856023506366307, "grad_norm": 0.5517216920852661, "learning_rate": 0.0001983329886407234, "loss": 2.4361038208007812, "step": 630 }, { "epoch": 0.0696484927630863, "grad_norm": 0.6257575154304504, "learning_rate": 0.0001982695520507474, "loss": 2.3455841064453127, "step": 640 }, { "epoch": 0.07073675046250952, "grad_norm": 0.713700532913208, "learning_rate": 0.00019820494141215104, "loss": 2.5119384765625, "step": 650 }, { "epoch": 0.07182500816193274, "grad_norm": 0.6029644012451172, "learning_rate": 0.0001981391574968522, "loss": 2.433802604675293, "step": 660 }, { "epoch": 0.07291326586135596, "grad_norm": 0.5936899185180664, "learning_rate": 0.00019807220109078634, "loss": 2.429648590087891, "step": 670 }, { "epoch": 0.07400152356077919, "grad_norm": 0.6892074346542358, "learning_rate": 0.00019800407299389676, "loss": 2.4622060775756838, "step": 680 }, { "epoch": 0.07508978126020241, "grad_norm": 0.5444376468658447, "learning_rate": 0.0001979347740201253, "loss": 2.443063163757324, "step": 690 }, { "epoch": 0.07617803895962563, "grad_norm": 0.5775953531265259, "learning_rate": 0.00019786430499740246, "loss": 2.432481575012207, "step": 700 }, { "epoch": 0.07726629665904887, "grad_norm": 0.5795350074768066, "learning_rate": 0.0001977926667676377, "loss": 2.4973833084106447, "step": 710 }, { "epoch": 0.07835455435847209, "grad_norm": 0.5367754101753235, "learning_rate": 0.00019771986018670917, "loss": 2.3666255950927733, "step": 720 }, { "epoch": 0.07944281205789532, "grad_norm": 0.5822617411613464, "learning_rate": 0.00019764588612445358, "loss": 2.385586738586426, "step": 730 }, { "epoch": 0.08053106975731854, "grad_norm": 0.5901954770088196, "learning_rate": 0.00019757074546465587, "loss": 2.370471954345703, "step": 740 }, { "epoch": 0.08161932745674176, "grad_norm": 0.6353778839111328, "learning_rate": 0.00019749443910503848, "loss": 2.396226692199707, "step": 750 }, { "epoch": 0.08270758515616498, "grad_norm": 0.6343770623207092, "learning_rate": 0.00019741696795725087, "loss": 2.401010513305664, "step": 760 }, { "epoch": 0.0837958428555882, "grad_norm": 0.5598312020301819, "learning_rate": 0.00019733833294685834, "loss": 2.2786861419677735, "step": 770 }, { "epoch": 0.08488410055501143, "grad_norm": 0.5484779477119446, "learning_rate": 0.00019725853501333123, "loss": 2.3955661773681642, "step": 780 }, { "epoch": 0.08597235825443465, "grad_norm": 0.6644891500473022, "learning_rate": 0.00019717757511003353, "loss": 2.3859668731689454, "step": 790 }, { "epoch": 0.08706061595385788, "grad_norm": 0.6514454483985901, "learning_rate": 0.00019709545420421156, "loss": 2.2458009719848633, "step": 800 }, { "epoch": 0.0881488736532811, "grad_norm": 0.5960633158683777, "learning_rate": 0.00019701217327698238, "loss": 2.3914718627929688, "step": 810 }, { "epoch": 0.08923713135270432, "grad_norm": 0.6240096688270569, "learning_rate": 0.00019692773332332216, "loss": 2.3869680404663085, "step": 820 }, { "epoch": 0.09032538905212754, "grad_norm": 0.5594795346260071, "learning_rate": 0.00019684213535205413, "loss": 2.3711660385131834, "step": 830 }, { "epoch": 0.09141364675155077, "grad_norm": 0.6088646650314331, "learning_rate": 0.0001967553803858367, "loss": 2.3576807022094726, "step": 840 }, { "epoch": 0.09250190445097399, "grad_norm": 0.46641722321510315, "learning_rate": 0.00019666746946115108, "loss": 2.2290084838867186, "step": 850 }, { "epoch": 0.09359016215039721, "grad_norm": 0.548875093460083, "learning_rate": 0.00019657840362828906, "loss": 2.327008056640625, "step": 860 }, { "epoch": 0.09467841984982044, "grad_norm": 0.5243982672691345, "learning_rate": 0.0001964881839513403, "loss": 2.3408859252929686, "step": 870 }, { "epoch": 0.09576667754924366, "grad_norm": 0.6235495209693909, "learning_rate": 0.0001963968115081798, "loss": 2.263168525695801, "step": 880 }, { "epoch": 0.09685493524866688, "grad_norm": 0.6063691973686218, "learning_rate": 0.00019630428739045476, "loss": 2.3421646118164063, "step": 890 }, { "epoch": 0.0979431929480901, "grad_norm": 0.5557937622070312, "learning_rate": 0.00019621061270357187, "loss": 2.3258382797241213, "step": 900 }, { "epoch": 0.09903145064751333, "grad_norm": 0.6151397228240967, "learning_rate": 0.00019611578856668386, "loss": 2.3854576110839845, "step": 910 }, { "epoch": 0.10011970834693655, "grad_norm": 0.644874095916748, "learning_rate": 0.00019601981611267616, "loss": 2.289360237121582, "step": 920 }, { "epoch": 0.10120796604635977, "grad_norm": 0.5509300827980042, "learning_rate": 0.00019592269648815346, "loss": 2.295314598083496, "step": 930 }, { "epoch": 0.102296223745783, "grad_norm": 0.5932837724685669, "learning_rate": 0.00019582443085342587, "loss": 2.3362094879150392, "step": 940 }, { "epoch": 0.10338448144520622, "grad_norm": 0.5630385279655457, "learning_rate": 0.0001957250203824953, "loss": 2.300915336608887, "step": 950 }, { "epoch": 0.10447273914462944, "grad_norm": 0.6143785715103149, "learning_rate": 0.00019562446626304115, "loss": 2.283652496337891, "step": 960 }, { "epoch": 0.10556099684405267, "grad_norm": 0.5924747586250305, "learning_rate": 0.00019552276969640628, "loss": 2.36254768371582, "step": 970 }, { "epoch": 0.10664925454347589, "grad_norm": 0.6027070879936218, "learning_rate": 0.00019541993189758263, "loss": 2.3686290740966798, "step": 980 }, { "epoch": 0.10773751224289912, "grad_norm": 0.5071986317634583, "learning_rate": 0.00019531595409519672, "loss": 2.310688591003418, "step": 990 }, { "epoch": 0.10882576994232235, "grad_norm": 0.6230975985527039, "learning_rate": 0.0001952108375314949, "loss": 2.1661685943603515, "step": 1000 }, { "epoch": 0.10882576994232235, "eval_loss": 2.3169119358062744, "eval_runtime": 587.2932, "eval_samples_per_second": 52.703, "eval_steps_per_second": 1.648, "step": 1000 }, { "epoch": 0.10991402764174557, "grad_norm": 0.6722395420074463, "learning_rate": 0.00019510458346232862, "loss": 2.205127143859863, "step": 1010 }, { "epoch": 0.1110022853411688, "grad_norm": 0.5277002453804016, "learning_rate": 0.00019499719315713932, "loss": 2.1974628448486326, "step": 1020 }, { "epoch": 0.11209054304059202, "grad_norm": 0.5719823241233826, "learning_rate": 0.0001948886678989433, "loss": 2.3115985870361326, "step": 1030 }, { "epoch": 0.11317880074001524, "grad_norm": 0.5792841911315918, "learning_rate": 0.00019477900898431648, "loss": 2.2694074630737306, "step": 1040 }, { "epoch": 0.11426705843943846, "grad_norm": 0.5490453839302063, "learning_rate": 0.00019466821772337877, "loss": 2.231657791137695, "step": 1050 }, { "epoch": 0.11535531613886169, "grad_norm": 0.5345600843429565, "learning_rate": 0.00019455629543977846, "loss": 2.334513282775879, "step": 1060 }, { "epoch": 0.11644357383828491, "grad_norm": 0.6602033972740173, "learning_rate": 0.0001944432434706765, "loss": 2.3895183563232423, "step": 1070 }, { "epoch": 0.11753183153770813, "grad_norm": 0.5924275517463684, "learning_rate": 0.0001943290631667303, "loss": 2.351070022583008, "step": 1080 }, { "epoch": 0.11862008923713135, "grad_norm": 0.5626043081283569, "learning_rate": 0.00019421375589207793, "loss": 2.3270200729370116, "step": 1090 }, { "epoch": 0.11970834693655458, "grad_norm": 0.5710933804512024, "learning_rate": 0.00019409732302432152, "loss": 2.308769416809082, "step": 1100 }, { "epoch": 0.1207966046359778, "grad_norm": 0.6023140549659729, "learning_rate": 0.00019397976595451094, "loss": 2.2540557861328123, "step": 1110 }, { "epoch": 0.12188486233540102, "grad_norm": 0.6819802522659302, "learning_rate": 0.00019386108608712715, "loss": 2.2449235916137695, "step": 1120 }, { "epoch": 0.12297312003482425, "grad_norm": 0.6211457252502441, "learning_rate": 0.00019374128484006545, "loss": 2.258294105529785, "step": 1130 }, { "epoch": 0.12406137773424747, "grad_norm": 0.520028293132782, "learning_rate": 0.00019362036364461847, "loss": 2.187278938293457, "step": 1140 }, { "epoch": 0.1251496354336707, "grad_norm": 0.5941503047943115, "learning_rate": 0.0001934983239454592, "loss": 2.2918350219726564, "step": 1150 }, { "epoch": 0.12623789313309391, "grad_norm": 0.5812289714813232, "learning_rate": 0.00019337516720062357, "loss": 2.255027961730957, "step": 1160 }, { "epoch": 0.12732615083251714, "grad_norm": 0.505490779876709, "learning_rate": 0.00019325089488149313, "loss": 2.242863655090332, "step": 1170 }, { "epoch": 0.12841440853194036, "grad_norm": 0.6723229289054871, "learning_rate": 0.00019312550847277744, "loss": 2.3193592071533202, "step": 1180 }, { "epoch": 0.12950266623136358, "grad_norm": 0.535140872001648, "learning_rate": 0.0001929990094724964, "loss": 2.256319046020508, "step": 1190 }, { "epoch": 0.1305909239307868, "grad_norm": 0.4813484847545624, "learning_rate": 0.00019287139939196224, "loss": 2.2660842895507813, "step": 1200 }, { "epoch": 0.13167918163021003, "grad_norm": 0.570446252822876, "learning_rate": 0.00019274267975576153, "loss": 2.2892129898071287, "step": 1210 }, { "epoch": 0.13276743932963325, "grad_norm": 0.6873188614845276, "learning_rate": 0.0001926128521017369, "loss": 2.3654247283935548, "step": 1220 }, { "epoch": 0.13385569702905648, "grad_norm": 0.48321738839149475, "learning_rate": 0.0001924819179809688, "loss": 2.224453353881836, "step": 1230 }, { "epoch": 0.1349439547284797, "grad_norm": 0.5957618355751038, "learning_rate": 0.00019234987895775686, "loss": 2.285516548156738, "step": 1240 }, { "epoch": 0.13603221242790292, "grad_norm": 0.6557724475860596, "learning_rate": 0.00019221673660960127, "loss": 2.3456472396850585, "step": 1250 }, { "epoch": 0.13712047012732614, "grad_norm": 0.560992956161499, "learning_rate": 0.0001920824925271838, "loss": 2.2950157165527343, "step": 1260 }, { "epoch": 0.13820872782674937, "grad_norm": 0.5748006105422974, "learning_rate": 0.00019194714831434896, "loss": 2.2706621170043944, "step": 1270 }, { "epoch": 0.1392969855261726, "grad_norm": 0.6105372309684753, "learning_rate": 0.00019181070558808475, "loss": 2.3399494171142576, "step": 1280 }, { "epoch": 0.1403852432255958, "grad_norm": 0.5753287672996521, "learning_rate": 0.00019167316597850333, "loss": 2.2844791412353516, "step": 1290 }, { "epoch": 0.14147350092501904, "grad_norm": 0.5580806136131287, "learning_rate": 0.00019153453112882166, "loss": 2.2780637741088867, "step": 1300 }, { "epoch": 0.14256175862444226, "grad_norm": 0.6475474238395691, "learning_rate": 0.00019139480269534168, "loss": 2.1635242462158204, "step": 1310 }, { "epoch": 0.14365001632386548, "grad_norm": 0.5461703538894653, "learning_rate": 0.00019125398234743067, "loss": 2.1374628067016603, "step": 1320 }, { "epoch": 0.1447382740232887, "grad_norm": 0.6155250668525696, "learning_rate": 0.00019111207176750127, "loss": 2.18671875, "step": 1330 }, { "epoch": 0.14582653172271193, "grad_norm": 0.5225923657417297, "learning_rate": 0.00019096907265099135, "loss": 2.2136383056640625, "step": 1340 }, { "epoch": 0.14691478942213515, "grad_norm": 0.5861334204673767, "learning_rate": 0.0001908249867063438, "loss": 2.2212467193603516, "step": 1350 }, { "epoch": 0.14800304712155837, "grad_norm": 0.4927869439125061, "learning_rate": 0.000190679815654986, "loss": 2.1569862365722656, "step": 1360 }, { "epoch": 0.1490913048209816, "grad_norm": 0.6709020733833313, "learning_rate": 0.00019053356123130953, "loss": 2.2681760787963867, "step": 1370 }, { "epoch": 0.15017956252040482, "grad_norm": 0.5057207942008972, "learning_rate": 0.00019038622518264905, "loss": 2.2577709197998046, "step": 1380 }, { "epoch": 0.15126782021982804, "grad_norm": 0.5065057873725891, "learning_rate": 0.00019023780926926177, "loss": 2.142281341552734, "step": 1390 }, { "epoch": 0.15235607791925126, "grad_norm": 0.5002779364585876, "learning_rate": 0.0001900883152643063, "loss": 2.325468826293945, "step": 1400 }, { "epoch": 0.15344433561867452, "grad_norm": 0.6079955697059631, "learning_rate": 0.0001899377449538214, "loss": 2.170610237121582, "step": 1410 }, { "epoch": 0.15453259331809774, "grad_norm": 0.5860960483551025, "learning_rate": 0.00018978610013670468, "loss": 2.1679641723632814, "step": 1420 }, { "epoch": 0.15562085101752096, "grad_norm": 0.5875873565673828, "learning_rate": 0.00018963338262469116, "loss": 2.2343332290649416, "step": 1430 }, { "epoch": 0.15670910871694418, "grad_norm": 0.5325888991355896, "learning_rate": 0.0001894795942423316, "loss": 2.2183040618896483, "step": 1440 }, { "epoch": 0.1577973664163674, "grad_norm": 0.5409967303276062, "learning_rate": 0.00018932473682697066, "loss": 2.17867374420166, "step": 1450 }, { "epoch": 0.15888562411579063, "grad_norm": 0.5937164425849915, "learning_rate": 0.00018916881222872504, "loss": 2.220071220397949, "step": 1460 }, { "epoch": 0.15997388181521385, "grad_norm": 0.6509461402893066, "learning_rate": 0.0001890118223104612, "loss": 2.2115047454833983, "step": 1470 }, { "epoch": 0.16106213951463708, "grad_norm": 0.6225976347923279, "learning_rate": 0.00018885376894777332, "loss": 2.241412544250488, "step": 1480 }, { "epoch": 0.1621503972140603, "grad_norm": 0.5052709579467773, "learning_rate": 0.00018869465402896076, "loss": 2.1810253143310545, "step": 1490 }, { "epoch": 0.16323865491348352, "grad_norm": 0.6119481325149536, "learning_rate": 0.00018853447945500556, "loss": 2.2947011947631837, "step": 1500 }, { "epoch": 0.16323865491348352, "eval_loss": 2.20023512840271, "eval_runtime": 587.0529, "eval_samples_per_second": 52.724, "eval_steps_per_second": 1.649, "step": 1500 }, { "epoch": 0.16432691261290674, "grad_norm": 0.5992363691329956, "learning_rate": 0.00018837324713954964, "loss": 2.2904293060302736, "step": 1510 }, { "epoch": 0.16541517031232997, "grad_norm": 0.66703200340271, "learning_rate": 0.00018821095900887203, "loss": 2.1766429901123048, "step": 1520 }, { "epoch": 0.1665034280117532, "grad_norm": 0.6062861084938049, "learning_rate": 0.00018804761700186586, "loss": 2.141710090637207, "step": 1530 }, { "epoch": 0.1675916857111764, "grad_norm": 0.6298074126243591, "learning_rate": 0.0001878832230700151, "loss": 2.130615997314453, "step": 1540 }, { "epoch": 0.16867994341059964, "grad_norm": 0.5489169955253601, "learning_rate": 0.0001877177791773713, "loss": 2.1672636032104493, "step": 1550 }, { "epoch": 0.16976820111002286, "grad_norm": 0.5847949981689453, "learning_rate": 0.00018755128730053023, "loss": 2.156511688232422, "step": 1560 }, { "epoch": 0.17085645880944608, "grad_norm": 0.5692253708839417, "learning_rate": 0.00018738374942860807, "loss": 2.0986377716064455, "step": 1570 }, { "epoch": 0.1719447165088693, "grad_norm": 0.5773114562034607, "learning_rate": 0.0001872151675632177, "loss": 2.1211204528808594, "step": 1580 }, { "epoch": 0.17303297420829253, "grad_norm": 0.569576621055603, "learning_rate": 0.00018704554371844496, "loss": 2.1663122177124023, "step": 1590 }, { "epoch": 0.17412123190771575, "grad_norm": 0.5821296572685242, "learning_rate": 0.00018687487992082437, "loss": 2.25234317779541, "step": 1600 }, { "epoch": 0.17520948960713897, "grad_norm": 0.6224921345710754, "learning_rate": 0.000186703178209315, "loss": 2.08530216217041, "step": 1610 }, { "epoch": 0.1762977473065622, "grad_norm": 0.7561960816383362, "learning_rate": 0.00018653044063527614, "loss": 2.2214725494384764, "step": 1620 }, { "epoch": 0.17738600500598542, "grad_norm": 0.6512922048568726, "learning_rate": 0.00018635666926244276, "loss": 2.1064992904663087, "step": 1630 }, { "epoch": 0.17847426270540864, "grad_norm": 0.6448703408241272, "learning_rate": 0.00018618186616690084, "loss": 2.238378715515137, "step": 1640 }, { "epoch": 0.17956252040483187, "grad_norm": 0.6052150130271912, "learning_rate": 0.00018600603343706262, "loss": 2.1941831588745115, "step": 1650 }, { "epoch": 0.1806507781042551, "grad_norm": 0.49514251947402954, "learning_rate": 0.0001858291731736416, "loss": 2.058866500854492, "step": 1660 }, { "epoch": 0.1817390358036783, "grad_norm": 0.6906781196594238, "learning_rate": 0.00018565128748962738, "loss": 2.212385559082031, "step": 1670 }, { "epoch": 0.18282729350310153, "grad_norm": 0.6092531681060791, "learning_rate": 0.00018547237851026063, "loss": 2.2459482192993163, "step": 1680 }, { "epoch": 0.18391555120252476, "grad_norm": 0.6431053280830383, "learning_rate": 0.00018529244837300746, "loss": 2.121844673156738, "step": 1690 }, { "epoch": 0.18500380890194798, "grad_norm": 0.5417641997337341, "learning_rate": 0.00018511149922753402, "loss": 2.143844413757324, "step": 1700 }, { "epoch": 0.1860920666013712, "grad_norm": 0.5495652556419373, "learning_rate": 0.00018492953323568083, "loss": 2.1220401763916015, "step": 1710 }, { "epoch": 0.18718032430079443, "grad_norm": 0.7368461489677429, "learning_rate": 0.00018474655257143678, "loss": 2.112496566772461, "step": 1720 }, { "epoch": 0.18826858200021765, "grad_norm": 0.5933881998062134, "learning_rate": 0.00018456255942091341, "loss": 2.2545331954956054, "step": 1730 }, { "epoch": 0.18935683969964087, "grad_norm": 0.5794192552566528, "learning_rate": 0.00018437755598231856, "loss": 2.171444320678711, "step": 1740 }, { "epoch": 0.1904450973990641, "grad_norm": 0.5667774677276611, "learning_rate": 0.00018419154446593032, "loss": 2.1689022064208983, "step": 1750 }, { "epoch": 0.19153335509848732, "grad_norm": 0.589802086353302, "learning_rate": 0.0001840045270940704, "loss": 2.116688346862793, "step": 1760 }, { "epoch": 0.19262161279791054, "grad_norm": 0.5414043664932251, "learning_rate": 0.0001838165061010778, "loss": 2.206948471069336, "step": 1770 }, { "epoch": 0.19370987049733376, "grad_norm": 0.5901210308074951, "learning_rate": 0.00018362748373328187, "loss": 2.0587100982666016, "step": 1780 }, { "epoch": 0.194798128196757, "grad_norm": 0.6130768060684204, "learning_rate": 0.0001834374622489758, "loss": 2.1653223037719727, "step": 1790 }, { "epoch": 0.1958863858961802, "grad_norm": 0.4660082459449768, "learning_rate": 0.00018324644391838927, "loss": 2.149919319152832, "step": 1800 }, { "epoch": 0.19697464359560343, "grad_norm": 0.48946431279182434, "learning_rate": 0.00018305443102366163, "loss": 2.166761016845703, "step": 1810 }, { "epoch": 0.19806290129502666, "grad_norm": 0.5410107374191284, "learning_rate": 0.00018286142585881445, "loss": 2.2590333938598635, "step": 1820 }, { "epoch": 0.19915115899444988, "grad_norm": 0.6120771765708923, "learning_rate": 0.0001826674307297242, "loss": 2.1067811965942385, "step": 1830 }, { "epoch": 0.2002394166938731, "grad_norm": 0.6054511070251465, "learning_rate": 0.00018247244795409467, "loss": 2.117809295654297, "step": 1840 }, { "epoch": 0.20132767439329632, "grad_norm": 0.5898885130882263, "learning_rate": 0.00018227647986142936, "loss": 2.1442087173461912, "step": 1850 }, { "epoch": 0.20241593209271955, "grad_norm": 0.551909863948822, "learning_rate": 0.00018207952879300342, "loss": 2.1360584259033204, "step": 1860 }, { "epoch": 0.20350418979214277, "grad_norm": 0.5962231159210205, "learning_rate": 0.00018188159710183594, "loss": 2.0945831298828126, "step": 1870 }, { "epoch": 0.204592447491566, "grad_norm": 0.5748026371002197, "learning_rate": 0.00018168268715266172, "loss": 2.149133491516113, "step": 1880 }, { "epoch": 0.20568070519098922, "grad_norm": 0.6263651251792908, "learning_rate": 0.00018148280132190302, "loss": 2.1301254272460937, "step": 1890 }, { "epoch": 0.20676896289041244, "grad_norm": 0.5330021977424622, "learning_rate": 0.00018128194199764126, "loss": 2.169965934753418, "step": 1900 }, { "epoch": 0.20785722058983566, "grad_norm": 0.5281866192817688, "learning_rate": 0.0001810801115795882, "loss": 2.0392730712890623, "step": 1910 }, { "epoch": 0.20894547828925888, "grad_norm": 0.522429347038269, "learning_rate": 0.0001808773124790577, "loss": 2.2333887100219725, "step": 1920 }, { "epoch": 0.2100337359886821, "grad_norm": 0.5848979949951172, "learning_rate": 0.00018067354711893656, "loss": 2.097432327270508, "step": 1930 }, { "epoch": 0.21112199368810533, "grad_norm": 0.6055752038955688, "learning_rate": 0.00018046881793365574, "loss": 2.1793869018554686, "step": 1940 }, { "epoch": 0.21221025138752855, "grad_norm": 0.6010363698005676, "learning_rate": 0.00018026312736916126, "loss": 2.124331474304199, "step": 1950 }, { "epoch": 0.21329850908695178, "grad_norm": 0.5671064853668213, "learning_rate": 0.00018005647788288493, "loss": 2.162104606628418, "step": 1960 }, { "epoch": 0.21438676678637503, "grad_norm": 0.5831570625305176, "learning_rate": 0.00017984887194371501, "loss": 2.1268938064575194, "step": 1970 }, { "epoch": 0.21547502448579825, "grad_norm": 0.5373016595840454, "learning_rate": 0.0001796403120319667, "loss": 2.1061019897460938, "step": 1980 }, { "epoch": 0.21656328218522147, "grad_norm": 0.5929492115974426, "learning_rate": 0.0001794308006393526, "loss": 2.1705223083496095, "step": 1990 }, { "epoch": 0.2176515398846447, "grad_norm": 0.4705328941345215, "learning_rate": 0.00017922034026895283, "loss": 2.074695587158203, "step": 2000 }, { "epoch": 0.2176515398846447, "eval_loss": 2.109147071838379, "eval_runtime": 586.9376, "eval_samples_per_second": 52.735, "eval_steps_per_second": 1.649, "step": 2000 }, { "epoch": 0.21873979758406792, "grad_norm": 0.5088332295417786, "learning_rate": 0.0001790089334351851, "loss": 2.1133037567138673, "step": 2010 }, { "epoch": 0.21982805528349114, "grad_norm": 0.5302846431732178, "learning_rate": 0.00017879658266377484, "loss": 2.1055421829223633, "step": 2020 }, { "epoch": 0.22091631298291436, "grad_norm": 0.512309730052948, "learning_rate": 0.00017858329049172484, "loss": 2.034654998779297, "step": 2030 }, { "epoch": 0.2220045706823376, "grad_norm": 0.5561679601669312, "learning_rate": 0.00017836905946728505, "loss": 2.1128475189208986, "step": 2040 }, { "epoch": 0.2230928283817608, "grad_norm": 0.5545385479927063, "learning_rate": 0.0001781538921499221, "loss": 2.051860809326172, "step": 2050 }, { "epoch": 0.22418108608118403, "grad_norm": 0.5441116094589233, "learning_rate": 0.0001779377911102887, "loss": 1.969563865661621, "step": 2060 }, { "epoch": 0.22526934378060726, "grad_norm": 0.5807257890701294, "learning_rate": 0.00017772075893019297, "loss": 2.0863178253173826, "step": 2070 }, { "epoch": 0.22635760148003048, "grad_norm": 0.634229302406311, "learning_rate": 0.00017750279820256756, "loss": 2.0736406326293944, "step": 2080 }, { "epoch": 0.2274458591794537, "grad_norm": 0.5438808798789978, "learning_rate": 0.0001772839115314388, "loss": 2.006355857849121, "step": 2090 }, { "epoch": 0.22853411687887693, "grad_norm": 0.6062809228897095, "learning_rate": 0.00017706410153189527, "loss": 2.0591571807861326, "step": 2100 }, { "epoch": 0.22962237457830015, "grad_norm": 0.5494603514671326, "learning_rate": 0.00017684337083005694, "loss": 2.143521308898926, "step": 2110 }, { "epoch": 0.23071063227772337, "grad_norm": 0.5180804133415222, "learning_rate": 0.00017662172206304351, "loss": 2.0645524978637697, "step": 2120 }, { "epoch": 0.2317988899771466, "grad_norm": 0.5837594866752625, "learning_rate": 0.0001763991578789431, "loss": 1.9541698455810548, "step": 2130 }, { "epoch": 0.23288714767656982, "grad_norm": 0.6127448678016663, "learning_rate": 0.00017617568093678044, "loss": 2.17177791595459, "step": 2140 }, { "epoch": 0.23397540537599304, "grad_norm": 0.5226433277130127, "learning_rate": 0.00017595129390648531, "loss": 2.0547914505004883, "step": 2150 }, { "epoch": 0.23506366307541626, "grad_norm": 0.5894423127174377, "learning_rate": 0.00017572599946886032, "loss": 2.0524356842041014, "step": 2160 }, { "epoch": 0.23615192077483949, "grad_norm": 0.6199406385421753, "learning_rate": 0.0001754998003155493, "loss": 2.0789115905761717, "step": 2170 }, { "epoch": 0.2372401784742627, "grad_norm": 0.5394810438156128, "learning_rate": 0.00017527269914900475, "loss": 2.0597148895263673, "step": 2180 }, { "epoch": 0.23832843617368593, "grad_norm": 0.49846354126930237, "learning_rate": 0.00017504469868245584, "loss": 2.0944677352905274, "step": 2190 }, { "epoch": 0.23941669387310915, "grad_norm": 0.47657492756843567, "learning_rate": 0.00017481580163987589, "loss": 2.122162437438965, "step": 2200 }, { "epoch": 0.24050495157253238, "grad_norm": 0.6801338195800781, "learning_rate": 0.00017458601075594964, "loss": 2.1052452087402345, "step": 2210 }, { "epoch": 0.2415932092719556, "grad_norm": 0.5712375044822693, "learning_rate": 0.000174355328776041, "loss": 2.0954410552978517, "step": 2220 }, { "epoch": 0.24268146697137882, "grad_norm": 0.5341486930847168, "learning_rate": 0.00017412375845615987, "loss": 2.1599788665771484, "step": 2230 }, { "epoch": 0.24376972467080205, "grad_norm": 0.5819491744041443, "learning_rate": 0.00017389130256292932, "loss": 2.115601921081543, "step": 2240 }, { "epoch": 0.24485798237022527, "grad_norm": 0.527596116065979, "learning_rate": 0.00017365796387355266, "loss": 2.1216785430908205, "step": 2250 }, { "epoch": 0.2459462400696485, "grad_norm": 0.532425582408905, "learning_rate": 0.00017342374517578007, "loss": 2.141047477722168, "step": 2260 }, { "epoch": 0.24703449776907171, "grad_norm": 0.5290660858154297, "learning_rate": 0.0001731886492678755, "loss": 2.042479705810547, "step": 2270 }, { "epoch": 0.24812275546849494, "grad_norm": 0.5581395626068115, "learning_rate": 0.00017295267895858305, "loss": 2.1573259353637697, "step": 2280 }, { "epoch": 0.24921101316791816, "grad_norm": 0.6137312650680542, "learning_rate": 0.0001727158370670935, "loss": 2.1984088897705076, "step": 2290 }, { "epoch": 0.2502992708673414, "grad_norm": 0.4954657554626465, "learning_rate": 0.00017247812642301062, "loss": 1.9827383041381836, "step": 2300 }, { "epoch": 0.2513875285667646, "grad_norm": 0.551364004611969, "learning_rate": 0.0001722395498663174, "loss": 2.064924621582031, "step": 2310 }, { "epoch": 0.25247578626618783, "grad_norm": 0.5545063018798828, "learning_rate": 0.00017200011024734205, "loss": 1.9985237121582031, "step": 2320 }, { "epoch": 0.25356404396561105, "grad_norm": 0.5492304563522339, "learning_rate": 0.00017175981042672395, "loss": 2.0118520736694334, "step": 2330 }, { "epoch": 0.2546523016650343, "grad_norm": 0.46815717220306396, "learning_rate": 0.0001715186532753796, "loss": 2.0273427963256836, "step": 2340 }, { "epoch": 0.2557405593644575, "grad_norm": 0.5318409204483032, "learning_rate": 0.00017127664167446814, "loss": 2.0612958908081054, "step": 2350 }, { "epoch": 0.2568288170638807, "grad_norm": 0.589786171913147, "learning_rate": 0.00017103377851535704, "loss": 2.0560323715209963, "step": 2360 }, { "epoch": 0.25791707476330394, "grad_norm": 0.5954175591468811, "learning_rate": 0.00017079006669958754, "loss": 2.025723457336426, "step": 2370 }, { "epoch": 0.25900533246272717, "grad_norm": 0.6750893592834473, "learning_rate": 0.00017054550913883998, "loss": 2.0966495513916015, "step": 2380 }, { "epoch": 0.2600935901621504, "grad_norm": 0.48345836997032166, "learning_rate": 0.00017030010875489896, "loss": 2.0325756072998047, "step": 2390 }, { "epoch": 0.2611818478615736, "grad_norm": 0.6194612383842468, "learning_rate": 0.0001700538684796185, "loss": 2.095437240600586, "step": 2400 }, { "epoch": 0.26227010556099684, "grad_norm": 0.6276369094848633, "learning_rate": 0.00016980679125488704, "loss": 2.0224342346191406, "step": 2410 }, { "epoch": 0.26335836326042006, "grad_norm": 0.6124218702316284, "learning_rate": 0.0001695588800325922, "loss": 2.0889892578125, "step": 2420 }, { "epoch": 0.2644466209598433, "grad_norm": 0.6168131828308105, "learning_rate": 0.00016931013777458554, "loss": 2.086269760131836, "step": 2430 }, { "epoch": 0.2655348786592665, "grad_norm": 0.5778802633285522, "learning_rate": 0.00016906056745264722, "loss": 2.06359977722168, "step": 2440 }, { "epoch": 0.2666231363586897, "grad_norm": 0.50979083776474, "learning_rate": 0.0001688101720484505, "loss": 2.0644145965576173, "step": 2450 }, { "epoch": 0.26771139405811295, "grad_norm": 0.6815667748451233, "learning_rate": 0.000168558954553526, "loss": 1.9590221405029298, "step": 2460 }, { "epoch": 0.2687996517575362, "grad_norm": 0.5399974584579468, "learning_rate": 0.00016830691796922614, "loss": 2.044365882873535, "step": 2470 }, { "epoch": 0.2698879094569594, "grad_norm": 0.5563638806343079, "learning_rate": 0.0001680540653066891, "loss": 1.989365577697754, "step": 2480 }, { "epoch": 0.2709761671563826, "grad_norm": 0.5071965456008911, "learning_rate": 0.000167800399586803, "loss": 2.1890398025512696, "step": 2490 }, { "epoch": 0.27206442485580584, "grad_norm": 0.5304718613624573, "learning_rate": 0.0001675459238401697, "loss": 1.9666751861572265, "step": 2500 }, { "epoch": 0.27206442485580584, "eval_loss": 2.052706718444824, "eval_runtime": 587.1428, "eval_samples_per_second": 52.716, "eval_steps_per_second": 1.649, "step": 2500 }, { "epoch": 0.27315268255522906, "grad_norm": 0.5595816969871521, "learning_rate": 0.0001672906411070687, "loss": 2.0600120544433596, "step": 2510 }, { "epoch": 0.2742409402546523, "grad_norm": 0.5852010846138, "learning_rate": 0.0001670345544374206, "loss": 2.028826904296875, "step": 2520 }, { "epoch": 0.2753291979540755, "grad_norm": 0.5964128375053406, "learning_rate": 0.00016677766689075096, "loss": 1.9598331451416016, "step": 2530 }, { "epoch": 0.27641745565349873, "grad_norm": 0.571686863899231, "learning_rate": 0.00016651998153615353, "loss": 1.9748113632202149, "step": 2540 }, { "epoch": 0.27750571335292196, "grad_norm": 0.6193922162055969, "learning_rate": 0.0001662615014522537, "loss": 2.085162353515625, "step": 2550 }, { "epoch": 0.2785939710523452, "grad_norm": 0.5795553922653198, "learning_rate": 0.00016600222972717164, "loss": 2.175711250305176, "step": 2560 }, { "epoch": 0.2796822287517684, "grad_norm": 0.5491994023323059, "learning_rate": 0.00016574216945848538, "loss": 2.1317411422729493, "step": 2570 }, { "epoch": 0.2807704864511916, "grad_norm": 0.5458104610443115, "learning_rate": 0.000165481323753194, "loss": 2.068903923034668, "step": 2580 }, { "epoch": 0.28185874415061485, "grad_norm": 0.6222167611122131, "learning_rate": 0.00016521969572768022, "loss": 1.999159049987793, "step": 2590 }, { "epoch": 0.28294700185003807, "grad_norm": 0.5796995759010315, "learning_rate": 0.00016495728850767343, "loss": 2.0736717224121093, "step": 2600 }, { "epoch": 0.2840352595494613, "grad_norm": 0.5838117003440857, "learning_rate": 0.00016469410522821214, "loss": 1.9951139450073243, "step": 2610 }, { "epoch": 0.2851235172488845, "grad_norm": 0.6098240613937378, "learning_rate": 0.0001644301490336067, "loss": 2.0833147048950194, "step": 2620 }, { "epoch": 0.28621177494830774, "grad_norm": 0.6246470212936401, "learning_rate": 0.00016416542307740161, "loss": 2.060029983520508, "step": 2630 }, { "epoch": 0.28730003264773096, "grad_norm": 0.5276803970336914, "learning_rate": 0.00016389993052233793, "loss": 2.019278144836426, "step": 2640 }, { "epoch": 0.2883882903471542, "grad_norm": 0.6400175094604492, "learning_rate": 0.0001636336745403153, "loss": 2.046988677978516, "step": 2650 }, { "epoch": 0.2894765480465774, "grad_norm": 0.5165756344795227, "learning_rate": 0.00016336665831235444, "loss": 1.9314437866210938, "step": 2660 }, { "epoch": 0.29056480574600063, "grad_norm": 0.5371330380439758, "learning_rate": 0.0001630988850285587, "loss": 1.9953683853149413, "step": 2670 }, { "epoch": 0.29165306344542385, "grad_norm": 0.5350714921951294, "learning_rate": 0.0001628303578880762, "loss": 2.0260534286499023, "step": 2680 }, { "epoch": 0.2927413211448471, "grad_norm": 0.5653142333030701, "learning_rate": 0.00016256108009906167, "loss": 1.9526407241821289, "step": 2690 }, { "epoch": 0.2938295788442703, "grad_norm": 0.5415879487991333, "learning_rate": 0.00016229105487863778, "loss": 2.050252342224121, "step": 2700 }, { "epoch": 0.2949178365436935, "grad_norm": 0.4817979633808136, "learning_rate": 0.00016202028545285718, "loss": 2.0294048309326174, "step": 2710 }, { "epoch": 0.29600609424311675, "grad_norm": 0.5869520902633667, "learning_rate": 0.00016174877505666357, "loss": 1.948918342590332, "step": 2720 }, { "epoch": 0.29709435194253997, "grad_norm": 0.5371376276016235, "learning_rate": 0.00016147652693385313, "loss": 2.028607177734375, "step": 2730 }, { "epoch": 0.2981826096419632, "grad_norm": 0.608590304851532, "learning_rate": 0.000161203544337036, "loss": 2.0580350875854494, "step": 2740 }, { "epoch": 0.2992708673413864, "grad_norm": 0.5166542530059814, "learning_rate": 0.0001609298305275972, "loss": 2.1726612091064452, "step": 2750 }, { "epoch": 0.30035912504080964, "grad_norm": 0.4902857840061188, "learning_rate": 0.00016065538877565753, "loss": 1.945541763305664, "step": 2760 }, { "epoch": 0.30144738274023286, "grad_norm": 0.5767205953598022, "learning_rate": 0.00016038022236003499, "loss": 1.8922840118408204, "step": 2770 }, { "epoch": 0.3025356404396561, "grad_norm": 0.5173133611679077, "learning_rate": 0.000160104334568205, "loss": 1.9178089141845702, "step": 2780 }, { "epoch": 0.3036238981390793, "grad_norm": 0.5458312630653381, "learning_rate": 0.00015982772869626167, "loss": 1.9625509262084961, "step": 2790 }, { "epoch": 0.30471215583850253, "grad_norm": 0.6096794605255127, "learning_rate": 0.00015955040804887803, "loss": 1.9656063079833985, "step": 2800 }, { "epoch": 0.3058004135379258, "grad_norm": 0.5105905532836914, "learning_rate": 0.00015927237593926668, "loss": 1.9899227142333984, "step": 2810 }, { "epoch": 0.30688867123734903, "grad_norm": 0.4678819477558136, "learning_rate": 0.0001589936356891404, "loss": 2.026172065734863, "step": 2820 }, { "epoch": 0.30797692893677225, "grad_norm": 0.6311321258544922, "learning_rate": 0.00015871419062867207, "loss": 1.9687185287475586, "step": 2830 }, { "epoch": 0.3090651866361955, "grad_norm": 0.5898714661598206, "learning_rate": 0.00015843404409645516, "loss": 2.0452117919921875, "step": 2840 }, { "epoch": 0.3101534443356187, "grad_norm": 0.4785173833370209, "learning_rate": 0.00015815319943946393, "loss": 1.920002555847168, "step": 2850 }, { "epoch": 0.3112417020350419, "grad_norm": 0.5722597241401672, "learning_rate": 0.00015787166001301307, "loss": 1.980157470703125, "step": 2860 }, { "epoch": 0.31232995973446515, "grad_norm": 0.6049121618270874, "learning_rate": 0.00015758942918071798, "loss": 2.0541561126708983, "step": 2870 }, { "epoch": 0.31341821743388837, "grad_norm": 0.6247254014015198, "learning_rate": 0.00015730651031445442, "loss": 2.0732309341430666, "step": 2880 }, { "epoch": 0.3145064751333116, "grad_norm": 0.5216240286827087, "learning_rate": 0.00015702290679431825, "loss": 2.015762710571289, "step": 2890 }, { "epoch": 0.3155947328327348, "grad_norm": 0.6961284875869751, "learning_rate": 0.000156738622008585, "loss": 2.052688980102539, "step": 2900 }, { "epoch": 0.31668299053215804, "grad_norm": 0.6234159469604492, "learning_rate": 0.00015645365935366946, "loss": 2.010626220703125, "step": 2910 }, { "epoch": 0.31777124823158126, "grad_norm": 0.5455389022827148, "learning_rate": 0.0001561680222340851, "loss": 2.1055572509765623, "step": 2920 }, { "epoch": 0.3188595059310045, "grad_norm": 0.6326649785041809, "learning_rate": 0.00015588171406240338, "loss": 1.915243911743164, "step": 2930 }, { "epoch": 0.3199477636304277, "grad_norm": 0.56302410364151, "learning_rate": 0.00015559473825921288, "loss": 1.885507583618164, "step": 2940 }, { "epoch": 0.32103602132985093, "grad_norm": 0.587032675743103, "learning_rate": 0.00015530709825307862, "loss": 1.9598285675048828, "step": 2950 }, { "epoch": 0.32212427902927415, "grad_norm": 0.5396708846092224, "learning_rate": 0.000155018797480501, "loss": 1.9466554641723632, "step": 2960 }, { "epoch": 0.3232125367286974, "grad_norm": 0.5461894869804382, "learning_rate": 0.00015472983938587468, "loss": 1.9678598403930665, "step": 2970 }, { "epoch": 0.3243007944281206, "grad_norm": 0.5173971652984619, "learning_rate": 0.00015444022742144758, "loss": 2.0659557342529298, "step": 2980 }, { "epoch": 0.3253890521275438, "grad_norm": 0.6960553526878357, "learning_rate": 0.00015414996504727947, "loss": 2.006389045715332, "step": 2990 }, { "epoch": 0.32647730982696704, "grad_norm": 0.5320561528205872, "learning_rate": 0.00015385905573120075, "loss": 1.9795562744140625, "step": 3000 }, { "epoch": 0.32647730982696704, "eval_loss": 2.002763032913208, "eval_runtime": 587.3305, "eval_samples_per_second": 52.699, "eval_steps_per_second": 1.648, "step": 3000 } ], "logging_steps": 10, "max_steps": 9189, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.654283695030272e+18, "train_batch_size": 32, "trial_name": null, "trial_params": null }