{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9993784959602238, "eval_steps": 500, "global_step": 804, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004972032318210068, "grad_norm": 2.5709357261657715, "learning_rate": 3.3333333333333335e-05, "loss": 1.307, "step": 4 }, { "epoch": 0.009944064636420136, "grad_norm": 1.4358521699905396, "learning_rate": 6.666666666666667e-05, "loss": 1.1509, "step": 8 }, { "epoch": 0.014916096954630205, "grad_norm": 1.1599832773208618, "learning_rate": 0.0001, "loss": 0.9128, "step": 12 }, { "epoch": 0.019888129272840272, "grad_norm": 0.9250568747520447, "learning_rate": 0.00013333333333333334, "loss": 0.7575, "step": 16 }, { "epoch": 0.024860161591050343, "grad_norm": 0.6691205501556396, "learning_rate": 0.0001666666666666667, "loss": 0.6885, "step": 20 }, { "epoch": 0.02983219390926041, "grad_norm": 0.6702026128768921, "learning_rate": 0.0002, "loss": 0.6703, "step": 24 }, { "epoch": 0.03480422622747048, "grad_norm": 0.6191584467887878, "learning_rate": 0.00019998702249713748, "loss": 0.6191, "step": 28 }, { "epoch": 0.039776258545680544, "grad_norm": 0.585008978843689, "learning_rate": 0.0001999480933568615, "loss": 0.6302, "step": 32 }, { "epoch": 0.044748290863890615, "grad_norm": 0.5618470907211304, "learning_rate": 0.00019988322268323268, "loss": 0.6047, "step": 36 }, { "epoch": 0.049720323182100686, "grad_norm": 0.5016953945159912, "learning_rate": 0.00019979242731343804, "loss": 0.6009, "step": 40 }, { "epoch": 0.05469235550031075, "grad_norm": 0.4973951578140259, "learning_rate": 0.00019967573081342103, "loss": 0.5741, "step": 44 }, { "epoch": 0.05966438781852082, "grad_norm": 0.5195545554161072, "learning_rate": 0.00019953316347176488, "loss": 0.5883, "step": 48 }, { "epoch": 0.06463642013673089, "grad_norm": 0.4920307993888855, "learning_rate": 0.00019936476229183133, "loss": 0.557, "step": 52 }, { "epoch": 0.06960845245494096, "grad_norm": 0.4726178050041199, "learning_rate": 0.0001991705709821562, "loss": 0.534, "step": 56 }, { "epoch": 0.07458048477315103, "grad_norm": 0.5112979412078857, "learning_rate": 0.0001989506399451051, "loss": 0.5725, "step": 60 }, { "epoch": 0.07955251709136109, "grad_norm": 0.4693872034549713, "learning_rate": 0.00019870502626379127, "loss": 0.5515, "step": 64 }, { "epoch": 0.08452454940957116, "grad_norm": 0.5028090476989746, "learning_rate": 0.00019843379368725977, "loss": 0.5525, "step": 68 }, { "epoch": 0.08949658172778123, "grad_norm": 0.4817284345626831, "learning_rate": 0.00019813701261394136, "loss": 0.5563, "step": 72 }, { "epoch": 0.0944686140459913, "grad_norm": 0.4770365357398987, "learning_rate": 0.00019781476007338058, "loss": 0.551, "step": 76 }, { "epoch": 0.09944064636420137, "grad_norm": 0.4698512554168701, "learning_rate": 0.0001974671197062428, "loss": 0.55, "step": 80 }, { "epoch": 0.10441267868241144, "grad_norm": 0.4815049469470978, "learning_rate": 0.0001970941817426052, "loss": 0.5324, "step": 84 }, { "epoch": 0.1093847110006215, "grad_norm": 0.47757378220558167, "learning_rate": 0.00019669604297853764, "loss": 0.5403, "step": 88 }, { "epoch": 0.11435674331883157, "grad_norm": 0.5221468806266785, "learning_rate": 0.00019627280675097908, "loss": 0.5585, "step": 92 }, { "epoch": 0.11932877563704164, "grad_norm": 0.5312801599502563, "learning_rate": 0.00019582458291091663, "loss": 0.5434, "step": 96 }, { "epoch": 0.12430080795525171, "grad_norm": 0.4535232186317444, "learning_rate": 0.00019535148779487363, "loss": 0.566, "step": 100 }, { "epoch": 0.12927284027346178, "grad_norm": 0.45621493458747864, "learning_rate": 0.00019485364419471454, "loss": 0.5339, "step": 104 }, { "epoch": 0.13424487259167184, "grad_norm": 0.4411988854408264, "learning_rate": 0.0001943311813257743, "loss": 0.5377, "step": 108 }, { "epoch": 0.13921690490988192, "grad_norm": 0.4519474506378174, "learning_rate": 0.00019378423479332046, "loss": 0.5392, "step": 112 }, { "epoch": 0.14418893722809198, "grad_norm": 0.4649061858654022, "learning_rate": 0.0001932129465573568, "loss": 0.5258, "step": 116 }, { "epoch": 0.14916096954630206, "grad_norm": 0.44414597749710083, "learning_rate": 0.00019261746489577765, "loss": 0.5237, "step": 120 }, { "epoch": 0.15413300186451212, "grad_norm": 0.4718000590801239, "learning_rate": 0.00019199794436588243, "loss": 0.5323, "step": 124 }, { "epoch": 0.15910503418272218, "grad_norm": 0.43624797463417053, "learning_rate": 0.0001913545457642601, "loss": 0.5179, "step": 128 }, { "epoch": 0.16407706650093226, "grad_norm": 0.47694411873817444, "learning_rate": 0.00019068743608505455, "loss": 0.54, "step": 132 }, { "epoch": 0.16904909881914232, "grad_norm": 0.4488740861415863, "learning_rate": 0.0001899967884766212, "loss": 0.5071, "step": 136 }, { "epoch": 0.1740211311373524, "grad_norm": 0.4883563220500946, "learning_rate": 0.00018928278219658643, "loss": 0.5273, "step": 140 }, { "epoch": 0.17899316345556246, "grad_norm": 0.4428342878818512, "learning_rate": 0.000188545602565321, "loss": 0.5205, "step": 144 }, { "epoch": 0.18396519577377252, "grad_norm": 0.4439612925052643, "learning_rate": 0.00018778544091784048, "loss": 0.5169, "step": 148 }, { "epoch": 0.1889372280919826, "grad_norm": 0.5181368589401245, "learning_rate": 0.00018700249455414394, "loss": 0.52, "step": 152 }, { "epoch": 0.19390926041019266, "grad_norm": 0.4589499831199646, "learning_rate": 0.00018619696668800492, "loss": 0.5212, "step": 156 }, { "epoch": 0.19888129272840274, "grad_norm": 0.4652368724346161, "learning_rate": 0.00018536906639422725, "loss": 0.5058, "step": 160 }, { "epoch": 0.2038533250466128, "grad_norm": 0.4471285343170166, "learning_rate": 0.0001845190085543795, "loss": 0.5139, "step": 164 }, { "epoch": 0.20882535736482288, "grad_norm": 0.4473588466644287, "learning_rate": 0.00018364701380102266, "loss": 0.5011, "step": 168 }, { "epoch": 0.21379738968303294, "grad_norm": 0.46769270300865173, "learning_rate": 0.000182753308460445, "loss": 0.5095, "step": 172 }, { "epoch": 0.218769422001243, "grad_norm": 0.4742557108402252, "learning_rate": 0.0001818381244939187, "loss": 0.522, "step": 176 }, { "epoch": 0.22374145431945308, "grad_norm": 0.4403395354747772, "learning_rate": 0.00018090169943749476, "loss": 0.5067, "step": 180 }, { "epoch": 0.22871348663766314, "grad_norm": 0.4548196792602539, "learning_rate": 0.00017994427634035015, "loss": 0.5079, "step": 184 }, { "epoch": 0.23368551895587322, "grad_norm": 0.48214584589004517, "learning_rate": 0.0001789661037017045, "loss": 0.4928, "step": 188 }, { "epoch": 0.23865755127408328, "grad_norm": 0.4306032061576843, "learning_rate": 0.00017796743540632223, "loss": 0.5083, "step": 192 }, { "epoch": 0.24362958359229334, "grad_norm": 0.4764976501464844, "learning_rate": 0.00017694853065861662, "loss": 0.4956, "step": 196 }, { "epoch": 0.24860161591050342, "grad_norm": 0.4228585958480835, "learning_rate": 0.00017590965391537316, "loss": 0.5158, "step": 200 }, { "epoch": 0.2535736482287135, "grad_norm": 0.4141365587711334, "learning_rate": 0.00017485107481711012, "loss": 0.4989, "step": 204 }, { "epoch": 0.25854568054692356, "grad_norm": 0.45275670289993286, "learning_rate": 0.00017377306811809304, "loss": 0.4952, "step": 208 }, { "epoch": 0.26351771286513365, "grad_norm": 0.4202629327774048, "learning_rate": 0.00017267591361502232, "loss": 0.5082, "step": 212 }, { "epoch": 0.2684897451833437, "grad_norm": 0.4502929449081421, "learning_rate": 0.00017155989607441213, "loss": 0.4974, "step": 216 }, { "epoch": 0.27346177750155376, "grad_norm": 0.4718655049800873, "learning_rate": 0.00017042530515867896, "loss": 0.5041, "step": 220 }, { "epoch": 0.27843380981976384, "grad_norm": 0.43044278025627136, "learning_rate": 0.00016927243535095997, "loss": 0.5007, "step": 224 }, { "epoch": 0.2834058421379739, "grad_norm": 0.4416678249835968, "learning_rate": 0.00016810158587867973, "loss": 0.5075, "step": 228 }, { "epoch": 0.28837787445618396, "grad_norm": 0.44607338309288025, "learning_rate": 0.00016691306063588583, "loss": 0.4979, "step": 232 }, { "epoch": 0.29334990677439404, "grad_norm": 0.44135963916778564, "learning_rate": 0.0001657071681043731, "loss": 0.5008, "step": 236 }, { "epoch": 0.2983219390926041, "grad_norm": 0.4461626410484314, "learning_rate": 0.00016448422127361706, "loss": 0.4994, "step": 240 }, { "epoch": 0.30329397141081416, "grad_norm": 0.4296169877052307, "learning_rate": 0.00016324453755953773, "loss": 0.508, "step": 244 }, { "epoch": 0.30826600372902424, "grad_norm": 0.4123411476612091, "learning_rate": 0.00016198843872211404, "loss": 0.491, "step": 248 }, { "epoch": 0.3132380360472343, "grad_norm": 0.4264468252658844, "learning_rate": 0.00016071625078187114, "loss": 0.5015, "step": 252 }, { "epoch": 0.31821006836544435, "grad_norm": 0.4258119761943817, "learning_rate": 0.00015942830393526176, "loss": 0.4982, "step": 256 }, { "epoch": 0.32318210068365444, "grad_norm": 0.44614851474761963, "learning_rate": 0.00015812493246896366, "loss": 0.5014, "step": 260 }, { "epoch": 0.3281541330018645, "grad_norm": 0.4335807263851166, "learning_rate": 0.00015680647467311557, "loss": 0.4919, "step": 264 }, { "epoch": 0.3331261653200746, "grad_norm": 0.4183286726474762, "learning_rate": 0.0001554732727535139, "loss": 0.477, "step": 268 }, { "epoch": 0.33809819763828464, "grad_norm": 0.43014243245124817, "learning_rate": 0.00015412567274279316, "loss": 0.4684, "step": 272 }, { "epoch": 0.3430702299564947, "grad_norm": 0.4089718163013458, "learning_rate": 0.0001527640244106133, "loss": 0.4927, "step": 276 }, { "epoch": 0.3480422622747048, "grad_norm": 0.40746763348579407, "learning_rate": 0.0001513886811728769, "loss": 0.4868, "step": 280 }, { "epoch": 0.35301429459291483, "grad_norm": 0.4374973177909851, "learning_rate": 0.00015000000000000001, "loss": 0.4826, "step": 284 }, { "epoch": 0.3579863269111249, "grad_norm": 0.4501773715019226, "learning_rate": 0.0001485983413242606, "loss": 0.4952, "step": 288 }, { "epoch": 0.362958359229335, "grad_norm": 0.4177991449832916, "learning_rate": 0.0001471840689462482, "loss": 0.49, "step": 292 }, { "epoch": 0.36793039154754503, "grad_norm": 0.4343775510787964, "learning_rate": 0.00014575754994043956, "loss": 0.4872, "step": 296 }, { "epoch": 0.3729024238657551, "grad_norm": 0.45072102546691895, "learning_rate": 0.00014431915455992414, "loss": 0.4907, "step": 300 }, { "epoch": 0.3778744561839652, "grad_norm": 0.4326207637786865, "learning_rate": 0.00014286925614030542, "loss": 0.4885, "step": 304 }, { "epoch": 0.3828464885021753, "grad_norm": 0.4340527653694153, "learning_rate": 0.0001414082310028012, "loss": 0.4772, "step": 308 }, { "epoch": 0.3878185208203853, "grad_norm": 0.4523162841796875, "learning_rate": 0.00013993645835656953, "loss": 0.4959, "step": 312 }, { "epoch": 0.3927905531385954, "grad_norm": 0.4163872003555298, "learning_rate": 0.0001384543202002851, "loss": 0.4889, "step": 316 }, { "epoch": 0.3977625854568055, "grad_norm": 0.417036771774292, "learning_rate": 0.00013696220122299112, "loss": 0.5005, "step": 320 }, { "epoch": 0.4027346177750155, "grad_norm": 0.43414178490638733, "learning_rate": 0.00013546048870425356, "loss": 0.489, "step": 324 }, { "epoch": 0.4077066500932256, "grad_norm": 0.4082673192024231, "learning_rate": 0.00013394957241364273, "loss": 0.4767, "step": 328 }, { "epoch": 0.4126786824114357, "grad_norm": 0.4241110682487488, "learning_rate": 0.00013242984450956828, "loss": 0.4757, "step": 332 }, { "epoch": 0.41765071472964577, "grad_norm": 0.4089127480983734, "learning_rate": 0.00013090169943749476, "loss": 0.4698, "step": 336 }, { "epoch": 0.4226227470478558, "grad_norm": 0.4317830502986908, "learning_rate": 0.0001293655338275631, "loss": 0.495, "step": 340 }, { "epoch": 0.4275947793660659, "grad_norm": 0.4141937792301178, "learning_rate": 0.0001278217463916453, "loss": 0.4813, "step": 344 }, { "epoch": 0.43256681168427596, "grad_norm": 0.4085291624069214, "learning_rate": 0.0001262707378198587, "loss": 0.4838, "step": 348 }, { "epoch": 0.437538844002486, "grad_norm": 0.4401163160800934, "learning_rate": 0.00012471291067656697, "loss": 0.4725, "step": 352 }, { "epoch": 0.4425108763206961, "grad_norm": 0.4499000310897827, "learning_rate": 0.00012314866929589432, "loss": 0.4738, "step": 356 }, { "epoch": 0.44748290863890616, "grad_norm": 0.4250274896621704, "learning_rate": 0.00012157841967678063, "loss": 0.48, "step": 360 }, { "epoch": 0.45245494095711625, "grad_norm": 0.4591006934642792, "learning_rate": 0.00012000256937760445, "loss": 0.4898, "step": 364 }, { "epoch": 0.4574269732753263, "grad_norm": 0.42636924982070923, "learning_rate": 0.00011842152741040116, "loss": 0.4736, "step": 368 }, { "epoch": 0.46239900559353636, "grad_norm": 0.41370445489883423, "learning_rate": 0.00011683570413470383, "loss": 0.479, "step": 372 }, { "epoch": 0.46737103791174645, "grad_norm": 0.41576653718948364, "learning_rate": 0.00011524551115103454, "loss": 0.4684, "step": 376 }, { "epoch": 0.4723430702299565, "grad_norm": 0.4330123960971832, "learning_rate": 0.00011365136119407319, "loss": 0.4642, "step": 380 }, { "epoch": 0.47731510254816656, "grad_norm": 0.43045657873153687, "learning_rate": 0.0001120536680255323, "loss": 0.483, "step": 384 }, { "epoch": 0.48228713486637664, "grad_norm": 0.4194320738315582, "learning_rate": 0.00011045284632676536, "loss": 0.4621, "step": 388 }, { "epoch": 0.4872591671845867, "grad_norm": 0.40911245346069336, "learning_rate": 0.00010884931159113586, "loss": 0.482, "step": 392 }, { "epoch": 0.49223119950279676, "grad_norm": 0.4329901337623596, "learning_rate": 0.00010724348001617625, "loss": 0.4743, "step": 396 }, { "epoch": 0.49720323182100684, "grad_norm": 0.42870208621025085, "learning_rate": 0.00010563576839556374, "loss": 0.4658, "step": 400 }, { "epoch": 0.5021752641392169, "grad_norm": 0.43135136365890503, "learning_rate": 0.00010402659401094152, "loss": 0.4651, "step": 404 }, { "epoch": 0.507147296457427, "grad_norm": 0.41581398248672485, "learning_rate": 0.00010241637452361323, "loss": 0.481, "step": 408 }, { "epoch": 0.512119328775637, "grad_norm": 0.4430304169654846, "learning_rate": 0.00010080552786613899, "loss": 0.467, "step": 412 }, { "epoch": 0.5170913610938471, "grad_norm": 0.4333083927631378, "learning_rate": 9.919447213386103e-05, "loss": 0.4659, "step": 416 }, { "epoch": 0.5220633934120572, "grad_norm": 0.42966219782829285, "learning_rate": 9.75836254763868e-05, "loss": 0.4608, "step": 420 }, { "epoch": 0.5270354257302673, "grad_norm": 0.44130048155784607, "learning_rate": 9.597340598905852e-05, "loss": 0.451, "step": 424 }, { "epoch": 0.5320074580484773, "grad_norm": 0.42254915833473206, "learning_rate": 9.436423160443625e-05, "loss": 0.4657, "step": 428 }, { "epoch": 0.5369794903666874, "grad_norm": 0.4129006266593933, "learning_rate": 9.275651998382377e-05, "loss": 0.4635, "step": 432 }, { "epoch": 0.5419515226848974, "grad_norm": 0.43645158410072327, "learning_rate": 9.115068840886417e-05, "loss": 0.4568, "step": 436 }, { "epoch": 0.5469235550031075, "grad_norm": 0.41948822140693665, "learning_rate": 8.954715367323468e-05, "loss": 0.4655, "step": 440 }, { "epoch": 0.5518955873213176, "grad_norm": 0.4248465895652771, "learning_rate": 8.79463319744677e-05, "loss": 0.4694, "step": 444 }, { "epoch": 0.5568676196395277, "grad_norm": 0.42567265033721924, "learning_rate": 8.634863880592686e-05, "loss": 0.454, "step": 448 }, { "epoch": 0.5618396519577378, "grad_norm": 0.4329916834831238, "learning_rate": 8.475448884896547e-05, "loss": 0.4609, "step": 452 }, { "epoch": 0.5668116842759477, "grad_norm": 0.40616366267204285, "learning_rate": 8.316429586529615e-05, "loss": 0.4641, "step": 456 }, { "epoch": 0.5717837165941578, "grad_norm": 0.4116172790527344, "learning_rate": 8.157847258959885e-05, "loss": 0.4484, "step": 460 }, { "epoch": 0.5767557489123679, "grad_norm": 0.43640103936195374, "learning_rate": 7.999743062239557e-05, "loss": 0.4582, "step": 464 }, { "epoch": 0.581727781230578, "grad_norm": 0.41392359137535095, "learning_rate": 7.84215803232194e-05, "loss": 0.4434, "step": 468 }, { "epoch": 0.5866998135487881, "grad_norm": 0.4084075093269348, "learning_rate": 7.685133070410571e-05, "loss": 0.4722, "step": 472 }, { "epoch": 0.5916718458669982, "grad_norm": 0.4227941632270813, "learning_rate": 7.528708932343304e-05, "loss": 0.4517, "step": 476 }, { "epoch": 0.5966438781852083, "grad_norm": 0.44045257568359375, "learning_rate": 7.372926218014131e-05, "loss": 0.4625, "step": 480 }, { "epoch": 0.6016159105034182, "grad_norm": 0.4112107753753662, "learning_rate": 7.217825360835473e-05, "loss": 0.4539, "step": 484 }, { "epoch": 0.6065879428216283, "grad_norm": 0.4590305685997009, "learning_rate": 7.063446617243694e-05, "loss": 0.4518, "step": 488 }, { "epoch": 0.6115599751398384, "grad_norm": 0.4143747389316559, "learning_rate": 6.909830056250527e-05, "loss": 0.4495, "step": 492 }, { "epoch": 0.6165320074580485, "grad_norm": 0.4207197427749634, "learning_rate": 6.757015549043175e-05, "loss": 0.4594, "step": 496 }, { "epoch": 0.6215040397762586, "grad_norm": 0.4427318274974823, "learning_rate": 6.605042758635729e-05, "loss": 0.4483, "step": 500 }, { "epoch": 0.6264760720944687, "grad_norm": 0.42062947154045105, "learning_rate": 6.453951129574644e-05, "loss": 0.4548, "step": 504 }, { "epoch": 0.6314481044126787, "grad_norm": 0.40602120757102966, "learning_rate": 6.30377987770089e-05, "loss": 0.4541, "step": 508 }, { "epoch": 0.6364201367308887, "grad_norm": 0.4235445261001587, "learning_rate": 6.154567979971493e-05, "loss": 0.4547, "step": 512 }, { "epoch": 0.6413921690490988, "grad_norm": 0.4362446367740631, "learning_rate": 6.006354164343046e-05, "loss": 0.4648, "step": 516 }, { "epoch": 0.6463642013673089, "grad_norm": 0.4211137890815735, "learning_rate": 5.859176899719883e-05, "loss": 0.4467, "step": 520 }, { "epoch": 0.651336233685519, "grad_norm": 0.423961341381073, "learning_rate": 5.713074385969457e-05, "loss": 0.4554, "step": 524 }, { "epoch": 0.656308266003729, "grad_norm": 0.4417620003223419, "learning_rate": 5.568084544007588e-05, "loss": 0.4681, "step": 528 }, { "epoch": 0.6612802983219391, "grad_norm": 0.4363749921321869, "learning_rate": 5.424245005956048e-05, "loss": 0.4389, "step": 532 }, { "epoch": 0.6662523306401492, "grad_norm": 0.42354437708854675, "learning_rate": 5.28159310537518e-05, "loss": 0.4524, "step": 536 }, { "epoch": 0.6712243629583592, "grad_norm": 0.42178061604499817, "learning_rate": 5.14016586757394e-05, "loss": 0.4473, "step": 540 }, { "epoch": 0.6761963952765693, "grad_norm": 0.4353598356246948, "learning_rate": 5.000000000000002e-05, "loss": 0.4473, "step": 544 }, { "epoch": 0.6811684275947794, "grad_norm": 0.4380674362182617, "learning_rate": 4.861131882712314e-05, "loss": 0.4579, "step": 548 }, { "epoch": 0.6861404599129894, "grad_norm": 0.4278354048728943, "learning_rate": 4.723597558938672e-05, "loss": 0.4355, "step": 552 }, { "epoch": 0.6911124922311995, "grad_norm": 0.41823214292526245, "learning_rate": 4.587432725720687e-05, "loss": 0.4394, "step": 556 }, { "epoch": 0.6960845245494096, "grad_norm": 0.43046334385871887, "learning_rate": 4.452672724648611e-05, "loss": 0.4529, "step": 560 }, { "epoch": 0.7010565568676196, "grad_norm": 0.430922269821167, "learning_rate": 4.3193525326884435e-05, "loss": 0.4462, "step": 564 }, { "epoch": 0.7060285891858297, "grad_norm": 0.4363158345222473, "learning_rate": 4.1875067531036374e-05, "loss": 0.458, "step": 568 }, { "epoch": 0.7110006215040398, "grad_norm": 0.41834723949432373, "learning_rate": 4.057169606473827e-05, "loss": 0.4548, "step": 572 }, { "epoch": 0.7159726538222498, "grad_norm": 0.4106977880001068, "learning_rate": 3.9283749218128885e-05, "loss": 0.463, "step": 576 }, { "epoch": 0.7209446861404599, "grad_norm": 0.45078086853027344, "learning_rate": 3.8011561277885964e-05, "loss": 0.4459, "step": 580 }, { "epoch": 0.72591671845867, "grad_norm": 0.4266386330127716, "learning_rate": 3.675546244046228e-05, "loss": 0.438, "step": 584 }, { "epoch": 0.7308887507768801, "grad_norm": 0.4289485514163971, "learning_rate": 3.5515778726382966e-05, "loss": 0.4522, "step": 588 }, { "epoch": 0.7358607830950901, "grad_norm": 0.4158768057823181, "learning_rate": 3.429283189562694e-05, "loss": 0.4424, "step": 592 }, { "epoch": 0.7408328154133001, "grad_norm": 0.4208343029022217, "learning_rate": 3.308693936411421e-05, "loss": 0.4311, "step": 596 }, { "epoch": 0.7458048477315102, "grad_norm": 0.44292351603507996, "learning_rate": 3.1898414121320276e-05, "loss": 0.4454, "step": 600 }, { "epoch": 0.7507768800497203, "grad_norm": 0.4283224940299988, "learning_rate": 3.072756464904006e-05, "loss": 0.4323, "step": 604 }, { "epoch": 0.7557489123679304, "grad_norm": 0.4522048234939575, "learning_rate": 2.9574694841321082e-05, "loss": 0.4514, "step": 608 }, { "epoch": 0.7607209446861405, "grad_norm": 0.41480395197868347, "learning_rate": 2.84401039255879e-05, "loss": 0.4422, "step": 612 }, { "epoch": 0.7656929770043506, "grad_norm": 0.43344831466674805, "learning_rate": 2.7324086384977698e-05, "loss": 0.443, "step": 616 }, { "epoch": 0.7706650093225605, "grad_norm": 0.4390140175819397, "learning_rate": 2.622693188190699e-05, "loss": 0.4655, "step": 620 }, { "epoch": 0.7756370416407706, "grad_norm": 0.41029900312423706, "learning_rate": 2.514892518288988e-05, "loss": 0.4196, "step": 624 }, { "epoch": 0.7806090739589807, "grad_norm": 0.413832426071167, "learning_rate": 2.409034608462686e-05, "loss": 0.4396, "step": 628 }, { "epoch": 0.7855811062771908, "grad_norm": 0.43535104393959045, "learning_rate": 2.3051469341383402e-05, "loss": 0.4353, "step": 632 }, { "epoch": 0.7905531385954009, "grad_norm": 0.44554823637008667, "learning_rate": 2.2032564593677774e-05, "loss": 0.4568, "step": 636 }, { "epoch": 0.795525170913611, "grad_norm": 0.4224577844142914, "learning_rate": 2.1033896298295508e-05, "loss": 0.4414, "step": 640 }, { "epoch": 0.800497203231821, "grad_norm": 0.4140743017196655, "learning_rate": 2.0055723659649904e-05, "loss": 0.4399, "step": 644 }, { "epoch": 0.805469235550031, "grad_norm": 0.43011415004730225, "learning_rate": 1.9098300562505266e-05, "loss": 0.4549, "step": 648 }, { "epoch": 0.8104412678682411, "grad_norm": 0.4245777130126953, "learning_rate": 1.8161875506081293e-05, "loss": 0.4444, "step": 652 }, { "epoch": 0.8154133001864512, "grad_norm": 0.44440820813179016, "learning_rate": 1.7246691539555028e-05, "loss": 0.46, "step": 656 }, { "epoch": 0.8203853325046613, "grad_norm": 0.414103627204895, "learning_rate": 1.6352986198977325e-05, "loss": 0.4532, "step": 660 }, { "epoch": 0.8253573648228714, "grad_norm": 0.41898444294929504, "learning_rate": 1.5480991445620542e-05, "loss": 0.4517, "step": 664 }, { "epoch": 0.8303293971410814, "grad_norm": 0.4177073836326599, "learning_rate": 1.4630933605772801e-05, "loss": 0.4335, "step": 668 }, { "epoch": 0.8353014294592915, "grad_norm": 0.4281357228755951, "learning_rate": 1.3803033311995072e-05, "loss": 0.4573, "step": 672 }, { "epoch": 0.8402734617775015, "grad_norm": 0.4267916977405548, "learning_rate": 1.2997505445856084e-05, "loss": 0.4387, "step": 676 }, { "epoch": 0.8452454940957116, "grad_norm": 0.42911484837532043, "learning_rate": 1.2214559082159537e-05, "loss": 0.4339, "step": 680 }, { "epoch": 0.8502175264139217, "grad_norm": 0.4185105264186859, "learning_rate": 1.1454397434679021e-05, "loss": 0.4453, "step": 684 }, { "epoch": 0.8551895587321318, "grad_norm": 0.4304141104221344, "learning_rate": 1.0717217803413604e-05, "loss": 0.4403, "step": 688 }, { "epoch": 0.8601615910503418, "grad_norm": 0.43691304326057434, "learning_rate": 1.0003211523378796e-05, "loss": 0.4349, "step": 692 }, { "epoch": 0.8651336233685519, "grad_norm": 0.4254210889339447, "learning_rate": 9.31256391494546e-06, "loss": 0.4312, "step": 696 }, { "epoch": 0.870105655686762, "grad_norm": 0.4237820506095886, "learning_rate": 8.645454235739903e-06, "loss": 0.4435, "step": 700 }, { "epoch": 0.875077688004972, "grad_norm": 0.4290446639060974, "learning_rate": 8.002055634117578e-06, "loss": 0.4314, "step": 704 }, { "epoch": 0.8800497203231821, "grad_norm": 0.41713830828666687, "learning_rate": 7.382535104222366e-06, "loss": 0.4261, "step": 708 }, { "epoch": 0.8850217526413922, "grad_norm": 0.442330539226532, "learning_rate": 6.787053442643232e-06, "loss": 0.435, "step": 712 }, { "epoch": 0.8899937849596022, "grad_norm": 0.4291313588619232, "learning_rate": 6.215765206679569e-06, "loss": 0.4309, "step": 716 }, { "epoch": 0.8949658172778123, "grad_norm": 0.4301079511642456, "learning_rate": 5.668818674225685e-06, "loss": 0.442, "step": 720 }, { "epoch": 0.8999378495960224, "grad_norm": 0.43183088302612305, "learning_rate": 5.146355805285452e-06, "loss": 0.4403, "step": 724 }, { "epoch": 0.9049098819142325, "grad_norm": 0.42470988631248474, "learning_rate": 4.648512205126376e-06, "loss": 0.4464, "step": 728 }, { "epoch": 0.9098819142324425, "grad_norm": 0.4176940619945526, "learning_rate": 4.175417089083378e-06, "loss": 0.4201, "step": 732 }, { "epoch": 0.9148539465506526, "grad_norm": 0.419644832611084, "learning_rate": 3.7271932490209328e-06, "loss": 0.4389, "step": 736 }, { "epoch": 0.9198259788688626, "grad_norm": 0.4146890640258789, "learning_rate": 3.3039570214623782e-06, "loss": 0.4538, "step": 740 }, { "epoch": 0.9247980111870727, "grad_norm": 0.4463767409324646, "learning_rate": 2.905818257394799e-06, "loss": 0.4284, "step": 744 }, { "epoch": 0.9297700435052828, "grad_norm": 0.4303642511367798, "learning_rate": 2.532880293757223e-06, "loss": 0.4363, "step": 748 }, { "epoch": 0.9347420758234929, "grad_norm": 0.42455166578292847, "learning_rate": 2.1852399266194314e-06, "loss": 0.4615, "step": 752 }, { "epoch": 0.939714108141703, "grad_norm": 0.41838544607162476, "learning_rate": 1.8629873860586566e-06, "loss": 0.4357, "step": 756 }, { "epoch": 0.944686140459913, "grad_norm": 0.42117899656295776, "learning_rate": 1.566206312740226e-06, "loss": 0.4337, "step": 760 }, { "epoch": 0.949658172778123, "grad_norm": 0.439235121011734, "learning_rate": 1.2949737362087156e-06, "loss": 0.4414, "step": 764 }, { "epoch": 0.9546302050963331, "grad_norm": 0.45641785860061646, "learning_rate": 1.0493600548948878e-06, "loss": 0.439, "step": 768 }, { "epoch": 0.9596022374145432, "grad_norm": 0.4211345314979553, "learning_rate": 8.294290178437969e-07, "loss": 0.4444, "step": 772 }, { "epoch": 0.9645742697327533, "grad_norm": 0.4054080843925476, "learning_rate": 6.352377081687011e-07, "loss": 0.4328, "step": 776 }, { "epoch": 0.9695463020509634, "grad_norm": 0.39851078391075134, "learning_rate": 4.668365282351372e-07, "loss": 0.4389, "step": 780 }, { "epoch": 0.9745183343691733, "grad_norm": 0.42228272557258606, "learning_rate": 3.2426918657900704e-07, "loss": 0.43, "step": 784 }, { "epoch": 0.9794903666873834, "grad_norm": 0.42619001865386963, "learning_rate": 2.0757268656198537e-07, "loss": 0.4424, "step": 788 }, { "epoch": 0.9844623990055935, "grad_norm": 0.4146987199783325, "learning_rate": 1.1677731676733584e-07, "loss": 0.4475, "step": 792 }, { "epoch": 0.9894344313238036, "grad_norm": 0.39335352182388306, "learning_rate": 5.190664313851068e-08, "loss": 0.4391, "step": 796 }, { "epoch": 0.9944064636420137, "grad_norm": 0.418887734413147, "learning_rate": 1.2977502862532297e-08, "loss": 0.4308, "step": 800 }, { "epoch": 0.9993784959602238, "grad_norm": 0.4512234926223755, "learning_rate": 0.0, "loss": 0.4518, "step": 804 } ], "logging_steps": 4, "max_steps": 804, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.314262857038168e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }