newmodel / checkpoint-804 /trainer_state.json
pp-beta's picture
Upload folder using huggingface_hub
f385de0 verified
Raw History Blame Contribute Delete
35.6 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9993784959602238,
"eval_steps": 500,
"global_step": 804,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.004972032318210068,
"grad_norm": 2.5709357261657715,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.307,
"step": 4
},
{
"epoch": 0.009944064636420136,
"grad_norm": 1.4358521699905396,
"learning_rate": 6.666666666666667e-05,
"loss": 1.1509,
"step": 8
},
{
"epoch": 0.014916096954630205,
"grad_norm": 1.1599832773208618,
"learning_rate": 0.0001,
"loss": 0.9128,
"step": 12
},
{
"epoch": 0.019888129272840272,
"grad_norm": 0.9250568747520447,
"learning_rate": 0.00013333333333333334,
"loss": 0.7575,
"step": 16
},
{
"epoch": 0.024860161591050343,
"grad_norm": 0.6691205501556396,
"learning_rate": 0.0001666666666666667,
"loss": 0.6885,
"step": 20
},
{
"epoch": 0.02983219390926041,
"grad_norm": 0.6702026128768921,
"learning_rate": 0.0002,
"loss": 0.6703,
"step": 24
},
{
"epoch": 0.03480422622747048,
"grad_norm": 0.6191584467887878,
"learning_rate": 0.00019998702249713748,
"loss": 0.6191,
"step": 28
},
{
"epoch": 0.039776258545680544,
"grad_norm": 0.585008978843689,
"learning_rate": 0.0001999480933568615,
"loss": 0.6302,
"step": 32
},
{
"epoch": 0.044748290863890615,
"grad_norm": 0.5618470907211304,
"learning_rate": 0.00019988322268323268,
"loss": 0.6047,
"step": 36
},
{
"epoch": 0.049720323182100686,
"grad_norm": 0.5016953945159912,
"learning_rate": 0.00019979242731343804,
"loss": 0.6009,
"step": 40
},
{
"epoch": 0.05469235550031075,
"grad_norm": 0.4973951578140259,
"learning_rate": 0.00019967573081342103,
"loss": 0.5741,
"step": 44
},
{
"epoch": 0.05966438781852082,
"grad_norm": 0.5195545554161072,
"learning_rate": 0.00019953316347176488,
"loss": 0.5883,
"step": 48
},
{
"epoch": 0.06463642013673089,
"grad_norm": 0.4920307993888855,
"learning_rate": 0.00019936476229183133,
"loss": 0.557,
"step": 52
},
{
"epoch": 0.06960845245494096,
"grad_norm": 0.4726178050041199,
"learning_rate": 0.0001991705709821562,
"loss": 0.534,
"step": 56
},
{
"epoch": 0.07458048477315103,
"grad_norm": 0.5112979412078857,
"learning_rate": 0.0001989506399451051,
"loss": 0.5725,
"step": 60
},
{
"epoch": 0.07955251709136109,
"grad_norm": 0.4693872034549713,
"learning_rate": 0.00019870502626379127,
"loss": 0.5515,
"step": 64
},
{
"epoch": 0.08452454940957116,
"grad_norm": 0.5028090476989746,
"learning_rate": 0.00019843379368725977,
"loss": 0.5525,
"step": 68
},
{
"epoch": 0.08949658172778123,
"grad_norm": 0.4817284345626831,
"learning_rate": 0.00019813701261394136,
"loss": 0.5563,
"step": 72
},
{
"epoch": 0.0944686140459913,
"grad_norm": 0.4770365357398987,
"learning_rate": 0.00019781476007338058,
"loss": 0.551,
"step": 76
},
{
"epoch": 0.09944064636420137,
"grad_norm": 0.4698512554168701,
"learning_rate": 0.0001974671197062428,
"loss": 0.55,
"step": 80
},
{
"epoch": 0.10441267868241144,
"grad_norm": 0.4815049469470978,
"learning_rate": 0.0001970941817426052,
"loss": 0.5324,
"step": 84
},
{
"epoch": 0.1093847110006215,
"grad_norm": 0.47757378220558167,
"learning_rate": 0.00019669604297853764,
"loss": 0.5403,
"step": 88
},
{
"epoch": 0.11435674331883157,
"grad_norm": 0.5221468806266785,
"learning_rate": 0.00019627280675097908,
"loss": 0.5585,
"step": 92
},
{
"epoch": 0.11932877563704164,
"grad_norm": 0.5312801599502563,
"learning_rate": 0.00019582458291091663,
"loss": 0.5434,
"step": 96
},
{
"epoch": 0.12430080795525171,
"grad_norm": 0.4535232186317444,
"learning_rate": 0.00019535148779487363,
"loss": 0.566,
"step": 100
},
{
"epoch": 0.12927284027346178,
"grad_norm": 0.45621493458747864,
"learning_rate": 0.00019485364419471454,
"loss": 0.5339,
"step": 104
},
{
"epoch": 0.13424487259167184,
"grad_norm": 0.4411988854408264,
"learning_rate": 0.0001943311813257743,
"loss": 0.5377,
"step": 108
},
{
"epoch": 0.13921690490988192,
"grad_norm": 0.4519474506378174,
"learning_rate": 0.00019378423479332046,
"loss": 0.5392,
"step": 112
},
{
"epoch": 0.14418893722809198,
"grad_norm": 0.4649061858654022,
"learning_rate": 0.0001932129465573568,
"loss": 0.5258,
"step": 116
},
{
"epoch": 0.14916096954630206,
"grad_norm": 0.44414597749710083,
"learning_rate": 0.00019261746489577765,
"loss": 0.5237,
"step": 120
},
{
"epoch": 0.15413300186451212,
"grad_norm": 0.4718000590801239,
"learning_rate": 0.00019199794436588243,
"loss": 0.5323,
"step": 124
},
{
"epoch": 0.15910503418272218,
"grad_norm": 0.43624797463417053,
"learning_rate": 0.0001913545457642601,
"loss": 0.5179,
"step": 128
},
{
"epoch": 0.16407706650093226,
"grad_norm": 0.47694411873817444,
"learning_rate": 0.00019068743608505455,
"loss": 0.54,
"step": 132
},
{
"epoch": 0.16904909881914232,
"grad_norm": 0.4488740861415863,
"learning_rate": 0.0001899967884766212,
"loss": 0.5071,
"step": 136
},
{
"epoch": 0.1740211311373524,
"grad_norm": 0.4883563220500946,
"learning_rate": 0.00018928278219658643,
"loss": 0.5273,
"step": 140
},
{
"epoch": 0.17899316345556246,
"grad_norm": 0.4428342878818512,
"learning_rate": 0.000188545602565321,
"loss": 0.5205,
"step": 144
},
{
"epoch": 0.18396519577377252,
"grad_norm": 0.4439612925052643,
"learning_rate": 0.00018778544091784048,
"loss": 0.5169,
"step": 148
},
{
"epoch": 0.1889372280919826,
"grad_norm": 0.5181368589401245,
"learning_rate": 0.00018700249455414394,
"loss": 0.52,
"step": 152
},
{
"epoch": 0.19390926041019266,
"grad_norm": 0.4589499831199646,
"learning_rate": 0.00018619696668800492,
"loss": 0.5212,
"step": 156
},
{
"epoch": 0.19888129272840274,
"grad_norm": 0.4652368724346161,
"learning_rate": 0.00018536906639422725,
"loss": 0.5058,
"step": 160
},
{
"epoch": 0.2038533250466128,
"grad_norm": 0.4471285343170166,
"learning_rate": 0.0001845190085543795,
"loss": 0.5139,
"step": 164
},
{
"epoch": 0.20882535736482288,
"grad_norm": 0.4473588466644287,
"learning_rate": 0.00018364701380102266,
"loss": 0.5011,
"step": 168
},
{
"epoch": 0.21379738968303294,
"grad_norm": 0.46769270300865173,
"learning_rate": 0.000182753308460445,
"loss": 0.5095,
"step": 172
},
{
"epoch": 0.218769422001243,
"grad_norm": 0.4742557108402252,
"learning_rate": 0.0001818381244939187,
"loss": 0.522,
"step": 176
},
{
"epoch": 0.22374145431945308,
"grad_norm": 0.4403395354747772,
"learning_rate": 0.00018090169943749476,
"loss": 0.5067,
"step": 180
},
{
"epoch": 0.22871348663766314,
"grad_norm": 0.4548196792602539,
"learning_rate": 0.00017994427634035015,
"loss": 0.5079,
"step": 184
},
{
"epoch": 0.23368551895587322,
"grad_norm": 0.48214584589004517,
"learning_rate": 0.0001789661037017045,
"loss": 0.4928,
"step": 188
},
{
"epoch": 0.23865755127408328,
"grad_norm": 0.4306032061576843,
"learning_rate": 0.00017796743540632223,
"loss": 0.5083,
"step": 192
},
{
"epoch": 0.24362958359229334,
"grad_norm": 0.4764976501464844,
"learning_rate": 0.00017694853065861662,
"loss": 0.4956,
"step": 196
},
{
"epoch": 0.24860161591050342,
"grad_norm": 0.4228585958480835,
"learning_rate": 0.00017590965391537316,
"loss": 0.5158,
"step": 200
},
{
"epoch": 0.2535736482287135,
"grad_norm": 0.4141365587711334,
"learning_rate": 0.00017485107481711012,
"loss": 0.4989,
"step": 204
},
{
"epoch": 0.25854568054692356,
"grad_norm": 0.45275670289993286,
"learning_rate": 0.00017377306811809304,
"loss": 0.4952,
"step": 208
},
{
"epoch": 0.26351771286513365,
"grad_norm": 0.4202629327774048,
"learning_rate": 0.00017267591361502232,
"loss": 0.5082,
"step": 212
},
{
"epoch": 0.2684897451833437,
"grad_norm": 0.4502929449081421,
"learning_rate": 0.00017155989607441213,
"loss": 0.4974,
"step": 216
},
{
"epoch": 0.27346177750155376,
"grad_norm": 0.4718655049800873,
"learning_rate": 0.00017042530515867896,
"loss": 0.5041,
"step": 220
},
{
"epoch": 0.27843380981976384,
"grad_norm": 0.43044278025627136,
"learning_rate": 0.00016927243535095997,
"loss": 0.5007,
"step": 224
},
{
"epoch": 0.2834058421379739,
"grad_norm": 0.4416678249835968,
"learning_rate": 0.00016810158587867973,
"loss": 0.5075,
"step": 228
},
{
"epoch": 0.28837787445618396,
"grad_norm": 0.44607338309288025,
"learning_rate": 0.00016691306063588583,
"loss": 0.4979,
"step": 232
},
{
"epoch": 0.29334990677439404,
"grad_norm": 0.44135963916778564,
"learning_rate": 0.0001657071681043731,
"loss": 0.5008,
"step": 236
},
{
"epoch": 0.2983219390926041,
"grad_norm": 0.4461626410484314,
"learning_rate": 0.00016448422127361706,
"loss": 0.4994,
"step": 240
},
{
"epoch": 0.30329397141081416,
"grad_norm": 0.4296169877052307,
"learning_rate": 0.00016324453755953773,
"loss": 0.508,
"step": 244
},
{
"epoch": 0.30826600372902424,
"grad_norm": 0.4123411476612091,
"learning_rate": 0.00016198843872211404,
"loss": 0.491,
"step": 248
},
{
"epoch": 0.3132380360472343,
"grad_norm": 0.4264468252658844,
"learning_rate": 0.00016071625078187114,
"loss": 0.5015,
"step": 252
},
{
"epoch": 0.31821006836544435,
"grad_norm": 0.4258119761943817,
"learning_rate": 0.00015942830393526176,
"loss": 0.4982,
"step": 256
},
{
"epoch": 0.32318210068365444,
"grad_norm": 0.44614851474761963,
"learning_rate": 0.00015812493246896366,
"loss": 0.5014,
"step": 260
},
{
"epoch": 0.3281541330018645,
"grad_norm": 0.4335807263851166,
"learning_rate": 0.00015680647467311557,
"loss": 0.4919,
"step": 264
},
{
"epoch": 0.3331261653200746,
"grad_norm": 0.4183286726474762,
"learning_rate": 0.0001554732727535139,
"loss": 0.477,
"step": 268
},
{
"epoch": 0.33809819763828464,
"grad_norm": 0.43014243245124817,
"learning_rate": 0.00015412567274279316,
"loss": 0.4684,
"step": 272
},
{
"epoch": 0.3430702299564947,
"grad_norm": 0.4089718163013458,
"learning_rate": 0.0001527640244106133,
"loss": 0.4927,
"step": 276
},
{
"epoch": 0.3480422622747048,
"grad_norm": 0.40746763348579407,
"learning_rate": 0.0001513886811728769,
"loss": 0.4868,
"step": 280
},
{
"epoch": 0.35301429459291483,
"grad_norm": 0.4374973177909851,
"learning_rate": 0.00015000000000000001,
"loss": 0.4826,
"step": 284
},
{
"epoch": 0.3579863269111249,
"grad_norm": 0.4501773715019226,
"learning_rate": 0.0001485983413242606,
"loss": 0.4952,
"step": 288
},
{
"epoch": 0.362958359229335,
"grad_norm": 0.4177991449832916,
"learning_rate": 0.0001471840689462482,
"loss": 0.49,
"step": 292
},
{
"epoch": 0.36793039154754503,
"grad_norm": 0.4343775510787964,
"learning_rate": 0.00014575754994043956,
"loss": 0.4872,
"step": 296
},
{
"epoch": 0.3729024238657551,
"grad_norm": 0.45072102546691895,
"learning_rate": 0.00014431915455992414,
"loss": 0.4907,
"step": 300
},
{
"epoch": 0.3778744561839652,
"grad_norm": 0.4326207637786865,
"learning_rate": 0.00014286925614030542,
"loss": 0.4885,
"step": 304
},
{
"epoch": 0.3828464885021753,
"grad_norm": 0.4340527653694153,
"learning_rate": 0.0001414082310028012,
"loss": 0.4772,
"step": 308
},
{
"epoch": 0.3878185208203853,
"grad_norm": 0.4523162841796875,
"learning_rate": 0.00013993645835656953,
"loss": 0.4959,
"step": 312
},
{
"epoch": 0.3927905531385954,
"grad_norm": 0.4163872003555298,
"learning_rate": 0.0001384543202002851,
"loss": 0.4889,
"step": 316
},
{
"epoch": 0.3977625854568055,
"grad_norm": 0.417036771774292,
"learning_rate": 0.00013696220122299112,
"loss": 0.5005,
"step": 320
},
{
"epoch": 0.4027346177750155,
"grad_norm": 0.43414178490638733,
"learning_rate": 0.00013546048870425356,
"loss": 0.489,
"step": 324
},
{
"epoch": 0.4077066500932256,
"grad_norm": 0.4082673192024231,
"learning_rate": 0.00013394957241364273,
"loss": 0.4767,
"step": 328
},
{
"epoch": 0.4126786824114357,
"grad_norm": 0.4241110682487488,
"learning_rate": 0.00013242984450956828,
"loss": 0.4757,
"step": 332
},
{
"epoch": 0.41765071472964577,
"grad_norm": 0.4089127480983734,
"learning_rate": 0.00013090169943749476,
"loss": 0.4698,
"step": 336
},
{
"epoch": 0.4226227470478558,
"grad_norm": 0.4317830502986908,
"learning_rate": 0.0001293655338275631,
"loss": 0.495,
"step": 340
},
{
"epoch": 0.4275947793660659,
"grad_norm": 0.4141937792301178,
"learning_rate": 0.0001278217463916453,
"loss": 0.4813,
"step": 344
},
{
"epoch": 0.43256681168427596,
"grad_norm": 0.4085291624069214,
"learning_rate": 0.0001262707378198587,
"loss": 0.4838,
"step": 348
},
{
"epoch": 0.437538844002486,
"grad_norm": 0.4401163160800934,
"learning_rate": 0.00012471291067656697,
"loss": 0.4725,
"step": 352
},
{
"epoch": 0.4425108763206961,
"grad_norm": 0.4499000310897827,
"learning_rate": 0.00012314866929589432,
"loss": 0.4738,
"step": 356
},
{
"epoch": 0.44748290863890616,
"grad_norm": 0.4250274896621704,
"learning_rate": 0.00012157841967678063,
"loss": 0.48,
"step": 360
},
{
"epoch": 0.45245494095711625,
"grad_norm": 0.4591006934642792,
"learning_rate": 0.00012000256937760445,
"loss": 0.4898,
"step": 364
},
{
"epoch": 0.4574269732753263,
"grad_norm": 0.42636924982070923,
"learning_rate": 0.00011842152741040116,
"loss": 0.4736,
"step": 368
},
{
"epoch": 0.46239900559353636,
"grad_norm": 0.41370445489883423,
"learning_rate": 0.00011683570413470383,
"loss": 0.479,
"step": 372
},
{
"epoch": 0.46737103791174645,
"grad_norm": 0.41576653718948364,
"learning_rate": 0.00011524551115103454,
"loss": 0.4684,
"step": 376
},
{
"epoch": 0.4723430702299565,
"grad_norm": 0.4330123960971832,
"learning_rate": 0.00011365136119407319,
"loss": 0.4642,
"step": 380
},
{
"epoch": 0.47731510254816656,
"grad_norm": 0.43045657873153687,
"learning_rate": 0.0001120536680255323,
"loss": 0.483,
"step": 384
},
{
"epoch": 0.48228713486637664,
"grad_norm": 0.4194320738315582,
"learning_rate": 0.00011045284632676536,
"loss": 0.4621,
"step": 388
},
{
"epoch": 0.4872591671845867,
"grad_norm": 0.40911245346069336,
"learning_rate": 0.00010884931159113586,
"loss": 0.482,
"step": 392
},
{
"epoch": 0.49223119950279676,
"grad_norm": 0.4329901337623596,
"learning_rate": 0.00010724348001617625,
"loss": 0.4743,
"step": 396
},
{
"epoch": 0.49720323182100684,
"grad_norm": 0.42870208621025085,
"learning_rate": 0.00010563576839556374,
"loss": 0.4658,
"step": 400
},
{
"epoch": 0.5021752641392169,
"grad_norm": 0.43135136365890503,
"learning_rate": 0.00010402659401094152,
"loss": 0.4651,
"step": 404
},
{
"epoch": 0.507147296457427,
"grad_norm": 0.41581398248672485,
"learning_rate": 0.00010241637452361323,
"loss": 0.481,
"step": 408
},
{
"epoch": 0.512119328775637,
"grad_norm": 0.4430304169654846,
"learning_rate": 0.00010080552786613899,
"loss": 0.467,
"step": 412
},
{
"epoch": 0.5170913610938471,
"grad_norm": 0.4333083927631378,
"learning_rate": 9.919447213386103e-05,
"loss": 0.4659,
"step": 416
},
{
"epoch": 0.5220633934120572,
"grad_norm": 0.42966219782829285,
"learning_rate": 9.75836254763868e-05,
"loss": 0.4608,
"step": 420
},
{
"epoch": 0.5270354257302673,
"grad_norm": 0.44130048155784607,
"learning_rate": 9.597340598905852e-05,
"loss": 0.451,
"step": 424
},
{
"epoch": 0.5320074580484773,
"grad_norm": 0.42254915833473206,
"learning_rate": 9.436423160443625e-05,
"loss": 0.4657,
"step": 428
},
{
"epoch": 0.5369794903666874,
"grad_norm": 0.4129006266593933,
"learning_rate": 9.275651998382377e-05,
"loss": 0.4635,
"step": 432
},
{
"epoch": 0.5419515226848974,
"grad_norm": 0.43645158410072327,
"learning_rate": 9.115068840886417e-05,
"loss": 0.4568,
"step": 436
},
{
"epoch": 0.5469235550031075,
"grad_norm": 0.41948822140693665,
"learning_rate": 8.954715367323468e-05,
"loss": 0.4655,
"step": 440
},
{
"epoch": 0.5518955873213176,
"grad_norm": 0.4248465895652771,
"learning_rate": 8.79463319744677e-05,
"loss": 0.4694,
"step": 444
},
{
"epoch": 0.5568676196395277,
"grad_norm": 0.42567265033721924,
"learning_rate": 8.634863880592686e-05,
"loss": 0.454,
"step": 448
},
{
"epoch": 0.5618396519577378,
"grad_norm": 0.4329916834831238,
"learning_rate": 8.475448884896547e-05,
"loss": 0.4609,
"step": 452
},
{
"epoch": 0.5668116842759477,
"grad_norm": 0.40616366267204285,
"learning_rate": 8.316429586529615e-05,
"loss": 0.4641,
"step": 456
},
{
"epoch": 0.5717837165941578,
"grad_norm": 0.4116172790527344,
"learning_rate": 8.157847258959885e-05,
"loss": 0.4484,
"step": 460
},
{
"epoch": 0.5767557489123679,
"grad_norm": 0.43640103936195374,
"learning_rate": 7.999743062239557e-05,
"loss": 0.4582,
"step": 464
},
{
"epoch": 0.581727781230578,
"grad_norm": 0.41392359137535095,
"learning_rate": 7.84215803232194e-05,
"loss": 0.4434,
"step": 468
},
{
"epoch": 0.5866998135487881,
"grad_norm": 0.4084075093269348,
"learning_rate": 7.685133070410571e-05,
"loss": 0.4722,
"step": 472
},
{
"epoch": 0.5916718458669982,
"grad_norm": 0.4227941632270813,
"learning_rate": 7.528708932343304e-05,
"loss": 0.4517,
"step": 476
},
{
"epoch": 0.5966438781852083,
"grad_norm": 0.44045257568359375,
"learning_rate": 7.372926218014131e-05,
"loss": 0.4625,
"step": 480
},
{
"epoch": 0.6016159105034182,
"grad_norm": 0.4112107753753662,
"learning_rate": 7.217825360835473e-05,
"loss": 0.4539,
"step": 484
},
{
"epoch": 0.6065879428216283,
"grad_norm": 0.4590305685997009,
"learning_rate": 7.063446617243694e-05,
"loss": 0.4518,
"step": 488
},
{
"epoch": 0.6115599751398384,
"grad_norm": 0.4143747389316559,
"learning_rate": 6.909830056250527e-05,
"loss": 0.4495,
"step": 492
},
{
"epoch": 0.6165320074580485,
"grad_norm": 0.4207197427749634,
"learning_rate": 6.757015549043175e-05,
"loss": 0.4594,
"step": 496
},
{
"epoch": 0.6215040397762586,
"grad_norm": 0.4427318274974823,
"learning_rate": 6.605042758635729e-05,
"loss": 0.4483,
"step": 500
},
{
"epoch": 0.6264760720944687,
"grad_norm": 0.42062947154045105,
"learning_rate": 6.453951129574644e-05,
"loss": 0.4548,
"step": 504
},
{
"epoch": 0.6314481044126787,
"grad_norm": 0.40602120757102966,
"learning_rate": 6.30377987770089e-05,
"loss": 0.4541,
"step": 508
},
{
"epoch": 0.6364201367308887,
"grad_norm": 0.4235445261001587,
"learning_rate": 6.154567979971493e-05,
"loss": 0.4547,
"step": 512
},
{
"epoch": 0.6413921690490988,
"grad_norm": 0.4362446367740631,
"learning_rate": 6.006354164343046e-05,
"loss": 0.4648,
"step": 516
},
{
"epoch": 0.6463642013673089,
"grad_norm": 0.4211137890815735,
"learning_rate": 5.859176899719883e-05,
"loss": 0.4467,
"step": 520
},
{
"epoch": 0.651336233685519,
"grad_norm": 0.423961341381073,
"learning_rate": 5.713074385969457e-05,
"loss": 0.4554,
"step": 524
},
{
"epoch": 0.656308266003729,
"grad_norm": 0.4417620003223419,
"learning_rate": 5.568084544007588e-05,
"loss": 0.4681,
"step": 528
},
{
"epoch": 0.6612802983219391,
"grad_norm": 0.4363749921321869,
"learning_rate": 5.424245005956048e-05,
"loss": 0.4389,
"step": 532
},
{
"epoch": 0.6662523306401492,
"grad_norm": 0.42354437708854675,
"learning_rate": 5.28159310537518e-05,
"loss": 0.4524,
"step": 536
},
{
"epoch": 0.6712243629583592,
"grad_norm": 0.42178061604499817,
"learning_rate": 5.14016586757394e-05,
"loss": 0.4473,
"step": 540
},
{
"epoch": 0.6761963952765693,
"grad_norm": 0.4353598356246948,
"learning_rate": 5.000000000000002e-05,
"loss": 0.4473,
"step": 544
},
{
"epoch": 0.6811684275947794,
"grad_norm": 0.4380674362182617,
"learning_rate": 4.861131882712314e-05,
"loss": 0.4579,
"step": 548
},
{
"epoch": 0.6861404599129894,
"grad_norm": 0.4278354048728943,
"learning_rate": 4.723597558938672e-05,
"loss": 0.4355,
"step": 552
},
{
"epoch": 0.6911124922311995,
"grad_norm": 0.41823214292526245,
"learning_rate": 4.587432725720687e-05,
"loss": 0.4394,
"step": 556
},
{
"epoch": 0.6960845245494096,
"grad_norm": 0.43046334385871887,
"learning_rate": 4.452672724648611e-05,
"loss": 0.4529,
"step": 560
},
{
"epoch": 0.7010565568676196,
"grad_norm": 0.430922269821167,
"learning_rate": 4.3193525326884435e-05,
"loss": 0.4462,
"step": 564
},
{
"epoch": 0.7060285891858297,
"grad_norm": 0.4363158345222473,
"learning_rate": 4.1875067531036374e-05,
"loss": 0.458,
"step": 568
},
{
"epoch": 0.7110006215040398,
"grad_norm": 0.41834723949432373,
"learning_rate": 4.057169606473827e-05,
"loss": 0.4548,
"step": 572
},
{
"epoch": 0.7159726538222498,
"grad_norm": 0.4106977880001068,
"learning_rate": 3.9283749218128885e-05,
"loss": 0.463,
"step": 576
},
{
"epoch": 0.7209446861404599,
"grad_norm": 0.45078086853027344,
"learning_rate": 3.8011561277885964e-05,
"loss": 0.4459,
"step": 580
},
{
"epoch": 0.72591671845867,
"grad_norm": 0.4266386330127716,
"learning_rate": 3.675546244046228e-05,
"loss": 0.438,
"step": 584
},
{
"epoch": 0.7308887507768801,
"grad_norm": 0.4289485514163971,
"learning_rate": 3.5515778726382966e-05,
"loss": 0.4522,
"step": 588
},
{
"epoch": 0.7358607830950901,
"grad_norm": 0.4158768057823181,
"learning_rate": 3.429283189562694e-05,
"loss": 0.4424,
"step": 592
},
{
"epoch": 0.7408328154133001,
"grad_norm": 0.4208343029022217,
"learning_rate": 3.308693936411421e-05,
"loss": 0.4311,
"step": 596
},
{
"epoch": 0.7458048477315102,
"grad_norm": 0.44292351603507996,
"learning_rate": 3.1898414121320276e-05,
"loss": 0.4454,
"step": 600
},
{
"epoch": 0.7507768800497203,
"grad_norm": 0.4283224940299988,
"learning_rate": 3.072756464904006e-05,
"loss": 0.4323,
"step": 604
},
{
"epoch": 0.7557489123679304,
"grad_norm": 0.4522048234939575,
"learning_rate": 2.9574694841321082e-05,
"loss": 0.4514,
"step": 608
},
{
"epoch": 0.7607209446861405,
"grad_norm": 0.41480395197868347,
"learning_rate": 2.84401039255879e-05,
"loss": 0.4422,
"step": 612
},
{
"epoch": 0.7656929770043506,
"grad_norm": 0.43344831466674805,
"learning_rate": 2.7324086384977698e-05,
"loss": 0.443,
"step": 616
},
{
"epoch": 0.7706650093225605,
"grad_norm": 0.4390140175819397,
"learning_rate": 2.622693188190699e-05,
"loss": 0.4655,
"step": 620
},
{
"epoch": 0.7756370416407706,
"grad_norm": 0.41029900312423706,
"learning_rate": 2.514892518288988e-05,
"loss": 0.4196,
"step": 624
},
{
"epoch": 0.7806090739589807,
"grad_norm": 0.413832426071167,
"learning_rate": 2.409034608462686e-05,
"loss": 0.4396,
"step": 628
},
{
"epoch": 0.7855811062771908,
"grad_norm": 0.43535104393959045,
"learning_rate": 2.3051469341383402e-05,
"loss": 0.4353,
"step": 632
},
{
"epoch": 0.7905531385954009,
"grad_norm": 0.44554823637008667,
"learning_rate": 2.2032564593677774e-05,
"loss": 0.4568,
"step": 636
},
{
"epoch": 0.795525170913611,
"grad_norm": 0.4224577844142914,
"learning_rate": 2.1033896298295508e-05,
"loss": 0.4414,
"step": 640
},
{
"epoch": 0.800497203231821,
"grad_norm": 0.4140743017196655,
"learning_rate": 2.0055723659649904e-05,
"loss": 0.4399,
"step": 644
},
{
"epoch": 0.805469235550031,
"grad_norm": 0.43011415004730225,
"learning_rate": 1.9098300562505266e-05,
"loss": 0.4549,
"step": 648
},
{
"epoch": 0.8104412678682411,
"grad_norm": 0.4245777130126953,
"learning_rate": 1.8161875506081293e-05,
"loss": 0.4444,
"step": 652
},
{
"epoch": 0.8154133001864512,
"grad_norm": 0.44440820813179016,
"learning_rate": 1.7246691539555028e-05,
"loss": 0.46,
"step": 656
},
{
"epoch": 0.8203853325046613,
"grad_norm": 0.414103627204895,
"learning_rate": 1.6352986198977325e-05,
"loss": 0.4532,
"step": 660
},
{
"epoch": 0.8253573648228714,
"grad_norm": 0.41898444294929504,
"learning_rate": 1.5480991445620542e-05,
"loss": 0.4517,
"step": 664
},
{
"epoch": 0.8303293971410814,
"grad_norm": 0.4177073836326599,
"learning_rate": 1.4630933605772801e-05,
"loss": 0.4335,
"step": 668
},
{
"epoch": 0.8353014294592915,
"grad_norm": 0.4281357228755951,
"learning_rate": 1.3803033311995072e-05,
"loss": 0.4573,
"step": 672
},
{
"epoch": 0.8402734617775015,
"grad_norm": 0.4267916977405548,
"learning_rate": 1.2997505445856084e-05,
"loss": 0.4387,
"step": 676
},
{
"epoch": 0.8452454940957116,
"grad_norm": 0.42911484837532043,
"learning_rate": 1.2214559082159537e-05,
"loss": 0.4339,
"step": 680
},
{
"epoch": 0.8502175264139217,
"grad_norm": 0.4185105264186859,
"learning_rate": 1.1454397434679021e-05,
"loss": 0.4453,
"step": 684
},
{
"epoch": 0.8551895587321318,
"grad_norm": 0.4304141104221344,
"learning_rate": 1.0717217803413604e-05,
"loss": 0.4403,
"step": 688
},
{
"epoch": 0.8601615910503418,
"grad_norm": 0.43691304326057434,
"learning_rate": 1.0003211523378796e-05,
"loss": 0.4349,
"step": 692
},
{
"epoch": 0.8651336233685519,
"grad_norm": 0.4254210889339447,
"learning_rate": 9.31256391494546e-06,
"loss": 0.4312,
"step": 696
},
{
"epoch": 0.870105655686762,
"grad_norm": 0.4237820506095886,
"learning_rate": 8.645454235739903e-06,
"loss": 0.4435,
"step": 700
},
{
"epoch": 0.875077688004972,
"grad_norm": 0.4290446639060974,
"learning_rate": 8.002055634117578e-06,
"loss": 0.4314,
"step": 704
},
{
"epoch": 0.8800497203231821,
"grad_norm": 0.41713830828666687,
"learning_rate": 7.382535104222366e-06,
"loss": 0.4261,
"step": 708
},
{
"epoch": 0.8850217526413922,
"grad_norm": 0.442330539226532,
"learning_rate": 6.787053442643232e-06,
"loss": 0.435,
"step": 712
},
{
"epoch": 0.8899937849596022,
"grad_norm": 0.4291313588619232,
"learning_rate": 6.215765206679569e-06,
"loss": 0.4309,
"step": 716
},
{
"epoch": 0.8949658172778123,
"grad_norm": 0.4301079511642456,
"learning_rate": 5.668818674225685e-06,
"loss": 0.442,
"step": 720
},
{
"epoch": 0.8999378495960224,
"grad_norm": 0.43183088302612305,
"learning_rate": 5.146355805285452e-06,
"loss": 0.4403,
"step": 724
},
{
"epoch": 0.9049098819142325,
"grad_norm": 0.42470988631248474,
"learning_rate": 4.648512205126376e-06,
"loss": 0.4464,
"step": 728
},
{
"epoch": 0.9098819142324425,
"grad_norm": 0.4176940619945526,
"learning_rate": 4.175417089083378e-06,
"loss": 0.4201,
"step": 732
},
{
"epoch": 0.9148539465506526,
"grad_norm": 0.419644832611084,
"learning_rate": 3.7271932490209328e-06,
"loss": 0.4389,
"step": 736
},
{
"epoch": 0.9198259788688626,
"grad_norm": 0.4146890640258789,
"learning_rate": 3.3039570214623782e-06,
"loss": 0.4538,
"step": 740
},
{
"epoch": 0.9247980111870727,
"grad_norm": 0.4463767409324646,
"learning_rate": 2.905818257394799e-06,
"loss": 0.4284,
"step": 744
},
{
"epoch": 0.9297700435052828,
"grad_norm": 0.4303642511367798,
"learning_rate": 2.532880293757223e-06,
"loss": 0.4363,
"step": 748
},
{
"epoch": 0.9347420758234929,
"grad_norm": 0.42455166578292847,
"learning_rate": 2.1852399266194314e-06,
"loss": 0.4615,
"step": 752
},
{
"epoch": 0.939714108141703,
"grad_norm": 0.41838544607162476,
"learning_rate": 1.8629873860586566e-06,
"loss": 0.4357,
"step": 756
},
{
"epoch": 0.944686140459913,
"grad_norm": 0.42117899656295776,
"learning_rate": 1.566206312740226e-06,
"loss": 0.4337,
"step": 760
},
{
"epoch": 0.949658172778123,
"grad_norm": 0.439235121011734,
"learning_rate": 1.2949737362087156e-06,
"loss": 0.4414,
"step": 764
},
{
"epoch": 0.9546302050963331,
"grad_norm": 0.45641785860061646,
"learning_rate": 1.0493600548948878e-06,
"loss": 0.439,
"step": 768
},
{
"epoch": 0.9596022374145432,
"grad_norm": 0.4211345314979553,
"learning_rate": 8.294290178437969e-07,
"loss": 0.4444,
"step": 772
},
{
"epoch": 0.9645742697327533,
"grad_norm": 0.4054080843925476,
"learning_rate": 6.352377081687011e-07,
"loss": 0.4328,
"step": 776
},
{
"epoch": 0.9695463020509634,
"grad_norm": 0.39851078391075134,
"learning_rate": 4.668365282351372e-07,
"loss": 0.4389,
"step": 780
},
{
"epoch": 0.9745183343691733,
"grad_norm": 0.42228272557258606,
"learning_rate": 3.2426918657900704e-07,
"loss": 0.43,
"step": 784
},
{
"epoch": 0.9794903666873834,
"grad_norm": 0.42619001865386963,
"learning_rate": 2.0757268656198537e-07,
"loss": 0.4424,
"step": 788
},
{
"epoch": 0.9844623990055935,
"grad_norm": 0.4146987199783325,
"learning_rate": 1.1677731676733584e-07,
"loss": 0.4475,
"step": 792
},
{
"epoch": 0.9894344313238036,
"grad_norm": 0.39335352182388306,
"learning_rate": 5.190664313851068e-08,
"loss": 0.4391,
"step": 796
},
{
"epoch": 0.9944064636420137,
"grad_norm": 0.418887734413147,
"learning_rate": 1.2977502862532297e-08,
"loss": 0.4308,
"step": 800
},
{
"epoch": 0.9993784959602238,
"grad_norm": 0.4512234926223755,
"learning_rate": 0.0,
"loss": 0.4518,
"step": 804
}
],
"logging_steps": 4,
"max_steps": 804,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.314262857038168e+18,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}