{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 28, "global_step": 141, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.02127659574468085, "grad_norm": 0.614821195602417, "learning_rate": 0.0, "loss": 0.81884765625, "step": 1 }, { "epoch": 0.0425531914893617, "grad_norm": 0.8086351156234741, "learning_rate": 1.25e-06, "loss": 0.83984375, "step": 2 }, { "epoch": 0.06382978723404255, "grad_norm": 0.5076808333396912, "learning_rate": 2.5e-06, "loss": 0.7861328125, "step": 3 }, { "epoch": 0.0851063829787234, "grad_norm": 12.88310718536377, "learning_rate": 3.7500000000000005e-06, "loss": 1.4091796875, "step": 4 }, { "epoch": 0.10638297872340426, "grad_norm": 1.8641468286514282, "learning_rate": 5e-06, "loss": 0.857421875, "step": 5 }, { "epoch": 0.1276595744680851, "grad_norm": 2.1419777870178223, "learning_rate": 6.25e-06, "loss": 0.82470703125, "step": 6 }, { "epoch": 0.14893617021276595, "grad_norm": 0.5267848968505859, "learning_rate": 7.500000000000001e-06, "loss": 0.81640625, "step": 7 }, { "epoch": 0.1702127659574468, "grad_norm": 0.4465678632259369, "learning_rate": 8.750000000000001e-06, "loss": 0.7666015625, "step": 8 }, { "epoch": 0.19148936170212766, "grad_norm": 0.364780068397522, "learning_rate": 1e-05, "loss": 0.716796875, "step": 9 }, { "epoch": 0.2127659574468085, "grad_norm": 0.4930365979671478, "learning_rate": 9.998744667454124e-06, "loss": 0.75439453125, "step": 10 }, { "epoch": 0.23404255319148937, "grad_norm": 0.4643309414386749, "learning_rate": 9.994979370198627e-06, "loss": 0.7685546875, "step": 11 }, { "epoch": 0.2553191489361702, "grad_norm": 0.25887879729270935, "learning_rate": 9.988706208989152e-06, "loss": 0.7080078125, "step": 12 }, { "epoch": 0.2765957446808511, "grad_norm": 0.21602444350719452, "learning_rate": 9.979928683782777e-06, "loss": 0.6953125, "step": 13 }, { "epoch": 0.2978723404255319, "grad_norm": 0.16701330244541168, "learning_rate": 9.968651691785309e-06, "loss": 0.6826171875, "step": 14 }, { "epoch": 0.3191489361702128, "grad_norm": 0.21458739042282104, "learning_rate": 9.954881524719004e-06, "loss": 0.71533203125, "step": 15 }, { "epoch": 0.3404255319148936, "grad_norm": 0.5292935967445374, "learning_rate": 9.938625865312252e-06, "loss": 0.638427734375, "step": 16 }, { "epoch": 0.3617021276595745, "grad_norm": 0.14642807841300964, "learning_rate": 9.91989378301319e-06, "loss": 0.69921875, "step": 17 }, { "epoch": 0.3829787234042553, "grad_norm": 0.2138093262910843, "learning_rate": 9.898695728929624e-06, "loss": 0.736328125, "step": 18 }, { "epoch": 0.40425531914893614, "grad_norm": 0.1565290242433548, "learning_rate": 9.875043529998089e-06, "loss": 0.66748046875, "step": 19 }, { "epoch": 0.425531914893617, "grad_norm": 0.14800888299942017, "learning_rate": 9.848950382385292e-06, "loss": 0.659423828125, "step": 20 }, { "epoch": 0.44680851063829785, "grad_norm": 0.17405381798744202, "learning_rate": 9.820430844125648e-06, "loss": 0.6953125, "step": 21 }, { "epoch": 0.46808510638297873, "grad_norm": 0.15458369255065918, "learning_rate": 9.789500826998963e-06, "loss": 0.64990234375, "step": 22 }, { "epoch": 0.48936170212765956, "grad_norm": 0.1480713188648224, "learning_rate": 9.756177587652857e-06, "loss": 0.665771484375, "step": 23 }, { "epoch": 0.5106382978723404, "grad_norm": 0.1611735075712204, "learning_rate": 9.720479717974834e-06, "loss": 0.65478515625, "step": 24 }, { "epoch": 0.5319148936170213, "grad_norm": 0.15233327448368073, "learning_rate": 9.682427134719397e-06, "loss": 0.6826171875, "step": 25 }, { "epoch": 0.5531914893617021, "grad_norm": 0.13786296546459198, "learning_rate": 9.642041068395971e-06, "loss": 0.65771484375, "step": 26 }, { "epoch": 0.574468085106383, "grad_norm": 0.1627306044101715, "learning_rate": 9.599344051423873e-06, "loss": 0.645751953125, "step": 27 }, { "epoch": 0.5957446808510638, "grad_norm": 0.11854298412799835, "learning_rate": 9.554359905560887e-06, "loss": 0.623291015625, "step": 28 }, { "epoch": 0.6170212765957447, "grad_norm": 0.09749210625886917, "learning_rate": 9.507113728612501e-06, "loss": 0.65673828125, "step": 29 }, { "epoch": 0.6170212765957447, "eval_loss": 0.6583251953125, "eval_runtime": 0.9309, "eval_samples_per_second": 8.594, "eval_steps_per_second": 1.074, "step": 29 }, { "epoch": 0.6382978723404256, "grad_norm": 0.09445308893918991, "learning_rate": 9.4576318804292e-06, "loss": 0.64990234375, "step": 30 }, { "epoch": 0.6595744680851063, "grad_norm": 0.12036604434251785, "learning_rate": 9.405941968199636e-06, "loss": 0.6259765625, "step": 31 }, { "epoch": 0.6808510638297872, "grad_norm": 0.09057900309562683, "learning_rate": 9.35207283104785e-06, "loss": 0.64892578125, "step": 32 }, { "epoch": 0.7021276595744681, "grad_norm": 0.08564602583646774, "learning_rate": 9.296054523943224e-06, "loss": 0.66357421875, "step": 33 }, { "epoch": 0.723404255319149, "grad_norm": 0.10631843656301498, "learning_rate": 9.237918300932005e-06, "loss": 0.656494140625, "step": 34 }, { "epoch": 0.7446808510638298, "grad_norm": 0.08722808957099915, "learning_rate": 9.177696597699903e-06, "loss": 0.64453125, "step": 35 }, { "epoch": 0.7659574468085106, "grad_norm": 0.49558505415916443, "learning_rate": 9.115423013475376e-06, "loss": 0.64208984375, "step": 36 }, { "epoch": 0.7872340425531915, "grad_norm": 0.08237365633249283, "learning_rate": 9.051132292283772e-06, "loss": 0.64404296875, "step": 37 }, { "epoch": 0.8085106382978723, "grad_norm": 0.07720646262168884, "learning_rate": 8.984860303562737e-06, "loss": 0.62109375, "step": 38 }, { "epoch": 0.8297872340425532, "grad_norm": 0.08277340978384018, "learning_rate": 8.91664402214975e-06, "loss": 0.679443359375, "step": 39 }, { "epoch": 0.851063829787234, "grad_norm": 0.07692992687225342, "learning_rate": 8.846521507652905e-06, "loss": 0.61279296875, "step": 40 }, { "epoch": 0.8723404255319149, "grad_norm": 0.07395167648792267, "learning_rate": 8.774531883216489e-06, "loss": 0.6171875, "step": 41 }, { "epoch": 0.8936170212765957, "grad_norm": 0.08734069019556046, "learning_rate": 8.700715313693179e-06, "loss": 0.5966796875, "step": 42 }, { "epoch": 0.9148936170212766, "grad_norm": 0.0718359649181366, "learning_rate": 8.625112983235038e-06, "loss": 0.622802734375, "step": 43 }, { "epoch": 0.9361702127659575, "grad_norm": 2.8077023029327393, "learning_rate": 8.547767072315835e-06, "loss": 0.633544921875, "step": 44 }, { "epoch": 0.9574468085106383, "grad_norm": 0.20353853702545166, "learning_rate": 8.468720734197465e-06, "loss": 0.64208984375, "step": 45 }, { "epoch": 0.9787234042553191, "grad_norm": 0.0717790350317955, "learning_rate": 8.388018070853643e-06, "loss": 0.63037109375, "step": 46 }, { "epoch": 1.0, "grad_norm": 0.07482967525720596, "learning_rate": 8.305704108364301e-06, "loss": 0.615478515625, "step": 47 }, { "epoch": 1.0212765957446808, "grad_norm": 0.07452995330095291, "learning_rate": 8.22182477179437e-06, "loss": 0.615234375, "step": 48 }, { "epoch": 1.0425531914893618, "grad_norm": 0.09891754388809204, "learning_rate": 8.136426859571014e-06, "loss": 0.63916015625, "step": 49 }, { "epoch": 1.0638297872340425, "grad_norm": 0.0689992755651474, "learning_rate": 8.049558017373593e-06, "loss": 0.61376953125, "step": 50 }, { "epoch": 1.0851063829787233, "grad_norm": 0.7521502375602722, "learning_rate": 7.961266711550922e-06, "loss": 0.59326171875, "step": 51 }, { "epoch": 1.1063829787234043, "grad_norm": 0.12467394024133682, "learning_rate": 7.871602202080656e-06, "loss": 0.632080078125, "step": 52 }, { "epoch": 1.127659574468085, "grad_norm": 0.10193628817796707, "learning_rate": 7.78061451508588e-06, "loss": 0.621826171875, "step": 53 }, { "epoch": 1.148936170212766, "grad_norm": 0.08595224469900131, "learning_rate": 7.688354414924266e-06, "loss": 0.6337890625, "step": 54 }, { "epoch": 1.1702127659574468, "grad_norm": 0.06556966155767441, "learning_rate": 7.594873375865336e-06, "loss": 0.612060546875, "step": 55 }, { "epoch": 1.1914893617021276, "grad_norm": 0.06449580192565918, "learning_rate": 7.500223553371642e-06, "loss": 0.587646484375, "step": 56 }, { "epoch": 1.2127659574468086, "grad_norm": 0.17886410653591156, "learning_rate": 7.404457754999913e-06, "loss": 0.6162109375, "step": 57 }, { "epoch": 1.2127659574468086, "eval_loss": 0.622802734375, "eval_runtime": 0.9118, "eval_samples_per_second": 8.774, "eval_steps_per_second": 1.097, "step": 57 }, { "epoch": 1.2340425531914894, "grad_norm": 0.1568862795829773, "learning_rate": 7.307629410938364e-06, "loss": 0.637451171875, "step": 58 }, { "epoch": 1.2553191489361701, "grad_norm": 0.06442597508430481, "learning_rate": 7.20979254419662e-06, "loss": 0.599609375, "step": 59 }, { "epoch": 1.2765957446808511, "grad_norm": 0.06344356387853622, "learning_rate": 7.11100174046491e-06, "loss": 0.596923828125, "step": 60 }, { "epoch": 1.297872340425532, "grad_norm": 0.06211620196700096, "learning_rate": 7.011312117659303e-06, "loss": 0.599365234375, "step": 61 }, { "epoch": 1.3191489361702127, "grad_norm": 0.06851235032081604, "learning_rate": 6.910779295170017e-06, "loss": 0.627197265625, "step": 62 }, { "epoch": 1.3404255319148937, "grad_norm": 0.07076431065797806, "learning_rate": 6.809459362829941e-06, "loss": 0.56201171875, "step": 63 }, { "epoch": 1.3617021276595744, "grad_norm": 0.062243252992630005, "learning_rate": 6.707408849620683e-06, "loss": 0.6279296875, "step": 64 }, { "epoch": 1.3829787234042552, "grad_norm": 0.1926475316286087, "learning_rate": 6.604684692133597e-06, "loss": 0.65380859375, "step": 65 }, { "epoch": 1.4042553191489362, "grad_norm": 0.06368491053581238, "learning_rate": 6.501344202803415e-06, "loss": 0.595947265625, "step": 66 }, { "epoch": 1.425531914893617, "grad_norm": 0.06680840253829956, "learning_rate": 6.397445037932167e-06, "loss": 0.59033203125, "step": 67 }, { "epoch": 1.4468085106382977, "grad_norm": 0.07508081942796707, "learning_rate": 6.293045165521249e-06, "loss": 0.609375, "step": 68 }, { "epoch": 1.4680851063829787, "grad_norm": 0.06227220967411995, "learning_rate": 6.188202832929607e-06, "loss": 0.580322265625, "step": 69 }, { "epoch": 1.4893617021276595, "grad_norm": 0.06462941318750381, "learning_rate": 6.0829765343760376e-06, "loss": 0.5986328125, "step": 70 }, { "epoch": 1.5106382978723403, "grad_norm": 0.07289247214794159, "learning_rate": 5.977424978303762e-06, "loss": 0.576171875, "step": 71 }, { "epoch": 1.5319148936170213, "grad_norm": 0.08890023827552795, "learning_rate": 5.871607054625497e-06, "loss": 0.6259765625, "step": 72 }, { "epoch": 1.5531914893617023, "grad_norm": 0.07831184566020966, "learning_rate": 5.765581801867254e-06, "loss": 0.5927734375, "step": 73 }, { "epoch": 1.574468085106383, "grad_norm": 0.07617679238319397, "learning_rate": 5.659408374229244e-06, "loss": 0.574951171875, "step": 74 }, { "epoch": 1.5957446808510638, "grad_norm": 0.0626956969499588, "learning_rate": 5.553146008582232e-06, "loss": 0.56689453125, "step": 75 }, { "epoch": 1.6170212765957448, "grad_norm": 0.06204919144511223, "learning_rate": 5.446853991417771e-06, "loss": 0.6123046875, "step": 76 }, { "epoch": 1.6382978723404256, "grad_norm": 0.06160138547420502, "learning_rate": 5.340591625770758e-06, "loss": 0.6025390625, "step": 77 }, { "epoch": 1.6595744680851063, "grad_norm": 0.11200636625289917, "learning_rate": 5.234418198132748e-06, "loss": 0.57666015625, "step": 78 }, { "epoch": 1.6808510638297873, "grad_norm": 0.06134967878460884, "learning_rate": 5.1283929453745055e-06, "loss": 0.60498046875, "step": 79 }, { "epoch": 1.702127659574468, "grad_norm": 0.06297880411148071, "learning_rate": 5.02257502169624e-06, "loss": 0.62060546875, "step": 80 }, { "epoch": 1.7234042553191489, "grad_norm": 0.06980058550834656, "learning_rate": 4.9170234656239655e-06, "loss": 0.611083984375, "step": 81 }, { "epoch": 1.7446808510638299, "grad_norm": 0.06381814926862717, "learning_rate": 4.811797167070393e-06, "loss": 0.60498046875, "step": 82 }, { "epoch": 1.7659574468085106, "grad_norm": 0.2403756082057953, "learning_rate": 4.706954834478753e-06, "loss": 0.59375, "step": 83 }, { "epoch": 1.7872340425531914, "grad_norm": 0.06059819459915161, "learning_rate": 4.602554962067836e-06, "loss": 0.60546875, "step": 84 }, { "epoch": 1.8085106382978724, "grad_norm": 0.06093069911003113, "learning_rate": 4.4986557971965865e-06, "loss": 0.584716796875, "step": 85 }, { "epoch": 1.8085106382978724, "eval_loss": 0.6068115234375, "eval_runtime": 0.9222, "eval_samples_per_second": 8.675, "eval_steps_per_second": 1.084, "step": 85 }, { "epoch": 1.8297872340425532, "grad_norm": 0.06800687313079834, "learning_rate": 4.395315307866404e-06, "loss": 0.642822265625, "step": 86 }, { "epoch": 1.851063829787234, "grad_norm": 0.06103246659040451, "learning_rate": 4.2925911503793205e-06, "loss": 0.58251953125, "step": 87 }, { "epoch": 1.872340425531915, "grad_norm": 0.061805445700883865, "learning_rate": 4.19054063717006e-06, "loss": 0.58056640625, "step": 88 }, { "epoch": 1.8936170212765957, "grad_norm": 0.07350873202085495, "learning_rate": 4.089220704829986e-06, "loss": 0.554443359375, "step": 89 }, { "epoch": 1.9148936170212765, "grad_norm": 0.06171874329447746, "learning_rate": 3.988687882340698e-06, "loss": 0.5888671875, "step": 90 }, { "epoch": 1.9361702127659575, "grad_norm": 0.262273371219635, "learning_rate": 3.888998259535092e-06, "loss": 0.55419921875, "step": 91 }, { "epoch": 1.9574468085106385, "grad_norm": 0.1396542489528656, "learning_rate": 3.790207455803381e-06, "loss": 0.6015625, "step": 92 }, { "epoch": 1.978723404255319, "grad_norm": 0.06226907670497894, "learning_rate": 3.692370589061639e-06, "loss": 0.599365234375, "step": 93 }, { "epoch": 2.0, "grad_norm": 0.06341912597417831, "learning_rate": 3.595542245000089e-06, "loss": 0.5810546875, "step": 94 }, { "epoch": 2.021276595744681, "grad_norm": 0.06388843804597855, "learning_rate": 3.499776446628361e-06, "loss": 0.584716796875, "step": 95 }, { "epoch": 2.0425531914893615, "grad_norm": 0.07137155532836914, "learning_rate": 3.4051266241346658e-06, "loss": 0.60986328125, "step": 96 }, { "epoch": 2.0638297872340425, "grad_norm": 0.0604974739253521, "learning_rate": 3.3116455850757343e-06, "loss": 0.587890625, "step": 97 }, { "epoch": 2.0851063829787235, "grad_norm": 8.030447006225586, "learning_rate": 3.2193854849141204e-06, "loss": 0.612548828125, "step": 98 }, { "epoch": 2.106382978723404, "grad_norm": 0.09623796492815018, "learning_rate": 3.1283977979193458e-06, "loss": 0.60302734375, "step": 99 }, { "epoch": 2.127659574468085, "grad_norm": 0.07766978442668915, "learning_rate": 3.0387332884490806e-06, "loss": 0.598388671875, "step": 100 }, { "epoch": 2.148936170212766, "grad_norm": 0.06870637089014053, "learning_rate": 2.9504419826264116e-06, "loss": 0.607666015625, "step": 101 }, { "epoch": 2.1702127659574466, "grad_norm": 0.060668252408504486, "learning_rate": 2.8635731404289895e-06, "loss": 0.5888671875, "step": 102 }, { "epoch": 2.1914893617021276, "grad_norm": 0.06026003509759903, "learning_rate": 2.7781752282056328e-06, "loss": 0.566162109375, "step": 103 }, { "epoch": 2.2127659574468086, "grad_norm": 0.08196396380662918, "learning_rate": 2.6942958916356997e-06, "loss": 0.59326171875, "step": 104 }, { "epoch": 2.2340425531914896, "grad_norm": 0.08349911868572235, "learning_rate": 2.6119819291463594e-06, "loss": 0.61376953125, "step": 105 }, { "epoch": 2.25531914893617, "grad_norm": 0.06174217164516449, "learning_rate": 2.531279265802538e-06, "loss": 0.577880859375, "step": 106 }, { "epoch": 2.276595744680851, "grad_norm": 0.060782574117183685, "learning_rate": 2.4522329276841664e-06, "loss": 0.5771484375, "step": 107 }, { "epoch": 2.297872340425532, "grad_norm": 0.059110283851623535, "learning_rate": 2.374887016764961e-06, "loss": 0.5810546875, "step": 108 }, { "epoch": 2.3191489361702127, "grad_norm": 0.06728767603635788, "learning_rate": 2.299284686306823e-06, "loss": 0.607177734375, "step": 109 }, { "epoch": 2.3404255319148937, "grad_norm": 0.06625807285308838, "learning_rate": 2.2254681167835123e-06, "loss": 0.544189453125, "step": 110 }, { "epoch": 2.3617021276595747, "grad_norm": 0.060310665518045425, "learning_rate": 2.153478492347097e-06, "loss": 0.6103515625, "step": 111 }, { "epoch": 2.382978723404255, "grad_norm": 0.07253512740135193, "learning_rate": 2.083355977850252e-06, "loss": 0.634033203125, "step": 112 }, { "epoch": 2.404255319148936, "grad_norm": 0.061543628573417664, "learning_rate": 2.0151396964372642e-06, "loss": 0.579345703125, "step": 113 }, { "epoch": 2.404255319148936, "eval_loss": 0.6005859375, "eval_runtime": 0.9332, "eval_samples_per_second": 8.572, "eval_steps_per_second": 1.072, "step": 113 }, { "epoch": 2.425531914893617, "grad_norm": 0.0641883984208107, "learning_rate": 1.94886770771623e-06, "loss": 0.57421875, "step": 114 }, { "epoch": 2.4468085106382977, "grad_norm": 0.07023778557777405, "learning_rate": 1.8845769865246256e-06, "loss": 0.591064453125, "step": 115 }, { "epoch": 2.4680851063829787, "grad_norm": 0.06087420508265495, "learning_rate": 1.822303402300099e-06, "loss": 0.564208984375, "step": 116 }, { "epoch": 2.4893617021276597, "grad_norm": 0.06413070857524872, "learning_rate": 1.7620816990679975e-06, "loss": 0.583740234375, "step": 117 }, { "epoch": 2.5106382978723403, "grad_norm": 0.06855274736881256, "learning_rate": 1.703945476056778e-06, "loss": 0.557861328125, "step": 118 }, { "epoch": 2.5319148936170213, "grad_norm": 0.07735947519540787, "learning_rate": 1.6479271689521504e-06, "loss": 0.613525390625, "step": 119 }, { "epoch": 2.5531914893617023, "grad_norm": 0.06765682250261307, "learning_rate": 1.5940580318003663e-06, "loss": 0.577392578125, "step": 120 }, { "epoch": 2.574468085106383, "grad_norm": 0.07223811745643616, "learning_rate": 1.5423681195707997e-06, "loss": 0.55908203125, "step": 121 }, { "epoch": 2.595744680851064, "grad_norm": 0.06124420091509819, "learning_rate": 1.4928862713874996e-06, "loss": 0.552490234375, "step": 122 }, { "epoch": 2.617021276595745, "grad_norm": 0.061064235866069794, "learning_rate": 1.4456400944391147e-06, "loss": 0.60009765625, "step": 123 }, { "epoch": 2.6382978723404253, "grad_norm": 0.059814613312482834, "learning_rate": 1.4006559485761282e-06, "loss": 0.59033203125, "step": 124 }, { "epoch": 2.6595744680851063, "grad_norm": 0.08451995998620987, "learning_rate": 1.3579589316040297e-06, "loss": 0.564208984375, "step": 125 }, { "epoch": 2.6808510638297873, "grad_norm": 0.061760902404785156, "learning_rate": 1.3175728652806047e-06, "loss": 0.594482421875, "step": 126 }, { "epoch": 2.702127659574468, "grad_norm": 0.061048850417137146, "learning_rate": 1.2795202820251665e-06, "loss": 0.609375, "step": 127 }, { "epoch": 2.723404255319149, "grad_norm": 0.06953231245279312, "learning_rate": 1.2438224123471442e-06, "loss": 0.598876953125, "step": 128 }, { "epoch": 2.74468085106383, "grad_norm": 0.05982961133122444, "learning_rate": 1.210499173001039e-06, "loss": 0.59521484375, "step": 129 }, { "epoch": 2.7659574468085104, "grad_norm": 0.0727211982011795, "learning_rate": 1.1795691558743535e-06, "loss": 0.581787109375, "step": 130 }, { "epoch": 2.7872340425531914, "grad_norm": 0.0596589520573616, "learning_rate": 1.1510496176147085e-06, "loss": 0.59716796875, "step": 131 }, { "epoch": 2.8085106382978724, "grad_norm": 0.05985628813505173, "learning_rate": 1.1249564700019127e-06, "loss": 0.57421875, "step": 132 }, { "epoch": 2.829787234042553, "grad_norm": 0.06684412807226181, "learning_rate": 1.1013042710703767e-06, "loss": 0.634521484375, "step": 133 }, { "epoch": 2.851063829787234, "grad_norm": 0.0605284757912159, "learning_rate": 1.0801062169868107e-06, "loss": 0.57470703125, "step": 134 }, { "epoch": 2.872340425531915, "grad_norm": 0.06104891747236252, "learning_rate": 1.0613741346877498e-06, "loss": 0.57080078125, "step": 135 }, { "epoch": 2.8936170212765955, "grad_norm": 0.0715995654463768, "learning_rate": 1.0451184752809978e-06, "loss": 0.5458984375, "step": 136 }, { "epoch": 2.9148936170212765, "grad_norm": 0.06113986298441887, "learning_rate": 1.0313483082146918e-06, "loss": 0.58056640625, "step": 137 }, { "epoch": 2.9361702127659575, "grad_norm": 0.0903206393122673, "learning_rate": 1.0200713162172245e-06, "loss": 0.5439453125, "step": 138 }, { "epoch": 2.9574468085106385, "grad_norm": 0.10972226411104202, "learning_rate": 1.0112937910108494e-06, "loss": 0.593505859375, "step": 139 }, { "epoch": 2.978723404255319, "grad_norm": 0.061755139380693436, "learning_rate": 1.005020629801373e-06, "loss": 0.591064453125, "step": 140 }, { "epoch": 3.0, "grad_norm": 0.0636168122291565, "learning_rate": 1.0012553325458768e-06, "loss": 0.574951171875, "step": 141 }, { "epoch": 3.0, "eval_loss": 0.59783935546875, "eval_runtime": 0.9275, "eval_samples_per_second": 8.625, "eval_steps_per_second": 1.078, "step": 141 } ], "logging_steps": 1.0, "max_steps": 141, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.173363486029775e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }