Minutor's picture
Add 11 files
cf276cf verified
Raw
History Blame Contribute Delete
27 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 28,
"global_step": 141,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02127659574468085,
"grad_norm": 0.614821195602417,
"learning_rate": 0.0,
"loss": 0.81884765625,
"step": 1
},
{
"epoch": 0.0425531914893617,
"grad_norm": 0.8086351156234741,
"learning_rate": 1.25e-06,
"loss": 0.83984375,
"step": 2
},
{
"epoch": 0.06382978723404255,
"grad_norm": 0.5076808333396912,
"learning_rate": 2.5e-06,
"loss": 0.7861328125,
"step": 3
},
{
"epoch": 0.0851063829787234,
"grad_norm": 12.88310718536377,
"learning_rate": 3.7500000000000005e-06,
"loss": 1.4091796875,
"step": 4
},
{
"epoch": 0.10638297872340426,
"grad_norm": 1.8641468286514282,
"learning_rate": 5e-06,
"loss": 0.857421875,
"step": 5
},
{
"epoch": 0.1276595744680851,
"grad_norm": 2.1419777870178223,
"learning_rate": 6.25e-06,
"loss": 0.82470703125,
"step": 6
},
{
"epoch": 0.14893617021276595,
"grad_norm": 0.5267848968505859,
"learning_rate": 7.500000000000001e-06,
"loss": 0.81640625,
"step": 7
},
{
"epoch": 0.1702127659574468,
"grad_norm": 0.4465678632259369,
"learning_rate": 8.750000000000001e-06,
"loss": 0.7666015625,
"step": 8
},
{
"epoch": 0.19148936170212766,
"grad_norm": 0.364780068397522,
"learning_rate": 1e-05,
"loss": 0.716796875,
"step": 9
},
{
"epoch": 0.2127659574468085,
"grad_norm": 0.4930365979671478,
"learning_rate": 9.998744667454124e-06,
"loss": 0.75439453125,
"step": 10
},
{
"epoch": 0.23404255319148937,
"grad_norm": 0.4643309414386749,
"learning_rate": 9.994979370198627e-06,
"loss": 0.7685546875,
"step": 11
},
{
"epoch": 0.2553191489361702,
"grad_norm": 0.25887879729270935,
"learning_rate": 9.988706208989152e-06,
"loss": 0.7080078125,
"step": 12
},
{
"epoch": 0.2765957446808511,
"grad_norm": 0.21602444350719452,
"learning_rate": 9.979928683782777e-06,
"loss": 0.6953125,
"step": 13
},
{
"epoch": 0.2978723404255319,
"grad_norm": 0.16701330244541168,
"learning_rate": 9.968651691785309e-06,
"loss": 0.6826171875,
"step": 14
},
{
"epoch": 0.3191489361702128,
"grad_norm": 0.21458739042282104,
"learning_rate": 9.954881524719004e-06,
"loss": 0.71533203125,
"step": 15
},
{
"epoch": 0.3404255319148936,
"grad_norm": 0.5292935967445374,
"learning_rate": 9.938625865312252e-06,
"loss": 0.638427734375,
"step": 16
},
{
"epoch": 0.3617021276595745,
"grad_norm": 0.14642807841300964,
"learning_rate": 9.91989378301319e-06,
"loss": 0.69921875,
"step": 17
},
{
"epoch": 0.3829787234042553,
"grad_norm": 0.2138093262910843,
"learning_rate": 9.898695728929624e-06,
"loss": 0.736328125,
"step": 18
},
{
"epoch": 0.40425531914893614,
"grad_norm": 0.1565290242433548,
"learning_rate": 9.875043529998089e-06,
"loss": 0.66748046875,
"step": 19
},
{
"epoch": 0.425531914893617,
"grad_norm": 0.14800888299942017,
"learning_rate": 9.848950382385292e-06,
"loss": 0.659423828125,
"step": 20
},
{
"epoch": 0.44680851063829785,
"grad_norm": 0.17405381798744202,
"learning_rate": 9.820430844125648e-06,
"loss": 0.6953125,
"step": 21
},
{
"epoch": 0.46808510638297873,
"grad_norm": 0.15458369255065918,
"learning_rate": 9.789500826998963e-06,
"loss": 0.64990234375,
"step": 22
},
{
"epoch": 0.48936170212765956,
"grad_norm": 0.1480713188648224,
"learning_rate": 9.756177587652857e-06,
"loss": 0.665771484375,
"step": 23
},
{
"epoch": 0.5106382978723404,
"grad_norm": 0.1611735075712204,
"learning_rate": 9.720479717974834e-06,
"loss": 0.65478515625,
"step": 24
},
{
"epoch": 0.5319148936170213,
"grad_norm": 0.15233327448368073,
"learning_rate": 9.682427134719397e-06,
"loss": 0.6826171875,
"step": 25
},
{
"epoch": 0.5531914893617021,
"grad_norm": 0.13786296546459198,
"learning_rate": 9.642041068395971e-06,
"loss": 0.65771484375,
"step": 26
},
{
"epoch": 0.574468085106383,
"grad_norm": 0.1627306044101715,
"learning_rate": 9.599344051423873e-06,
"loss": 0.645751953125,
"step": 27
},
{
"epoch": 0.5957446808510638,
"grad_norm": 0.11854298412799835,
"learning_rate": 9.554359905560887e-06,
"loss": 0.623291015625,
"step": 28
},
{
"epoch": 0.6170212765957447,
"grad_norm": 0.09749210625886917,
"learning_rate": 9.507113728612501e-06,
"loss": 0.65673828125,
"step": 29
},
{
"epoch": 0.6170212765957447,
"eval_loss": 0.6583251953125,
"eval_runtime": 0.9309,
"eval_samples_per_second": 8.594,
"eval_steps_per_second": 1.074,
"step": 29
},
{
"epoch": 0.6382978723404256,
"grad_norm": 0.09445308893918991,
"learning_rate": 9.4576318804292e-06,
"loss": 0.64990234375,
"step": 30
},
{
"epoch": 0.6595744680851063,
"grad_norm": 0.12036604434251785,
"learning_rate": 9.405941968199636e-06,
"loss": 0.6259765625,
"step": 31
},
{
"epoch": 0.6808510638297872,
"grad_norm": 0.09057900309562683,
"learning_rate": 9.35207283104785e-06,
"loss": 0.64892578125,
"step": 32
},
{
"epoch": 0.7021276595744681,
"grad_norm": 0.08564602583646774,
"learning_rate": 9.296054523943224e-06,
"loss": 0.66357421875,
"step": 33
},
{
"epoch": 0.723404255319149,
"grad_norm": 0.10631843656301498,
"learning_rate": 9.237918300932005e-06,
"loss": 0.656494140625,
"step": 34
},
{
"epoch": 0.7446808510638298,
"grad_norm": 0.08722808957099915,
"learning_rate": 9.177696597699903e-06,
"loss": 0.64453125,
"step": 35
},
{
"epoch": 0.7659574468085106,
"grad_norm": 0.49558505415916443,
"learning_rate": 9.115423013475376e-06,
"loss": 0.64208984375,
"step": 36
},
{
"epoch": 0.7872340425531915,
"grad_norm": 0.08237365633249283,
"learning_rate": 9.051132292283772e-06,
"loss": 0.64404296875,
"step": 37
},
{
"epoch": 0.8085106382978723,
"grad_norm": 0.07720646262168884,
"learning_rate": 8.984860303562737e-06,
"loss": 0.62109375,
"step": 38
},
{
"epoch": 0.8297872340425532,
"grad_norm": 0.08277340978384018,
"learning_rate": 8.91664402214975e-06,
"loss": 0.679443359375,
"step": 39
},
{
"epoch": 0.851063829787234,
"grad_norm": 0.07692992687225342,
"learning_rate": 8.846521507652905e-06,
"loss": 0.61279296875,
"step": 40
},
{
"epoch": 0.8723404255319149,
"grad_norm": 0.07395167648792267,
"learning_rate": 8.774531883216489e-06,
"loss": 0.6171875,
"step": 41
},
{
"epoch": 0.8936170212765957,
"grad_norm": 0.08734069019556046,
"learning_rate": 8.700715313693179e-06,
"loss": 0.5966796875,
"step": 42
},
{
"epoch": 0.9148936170212766,
"grad_norm": 0.0718359649181366,
"learning_rate": 8.625112983235038e-06,
"loss": 0.622802734375,
"step": 43
},
{
"epoch": 0.9361702127659575,
"grad_norm": 2.8077023029327393,
"learning_rate": 8.547767072315835e-06,
"loss": 0.633544921875,
"step": 44
},
{
"epoch": 0.9574468085106383,
"grad_norm": 0.20353853702545166,
"learning_rate": 8.468720734197465e-06,
"loss": 0.64208984375,
"step": 45
},
{
"epoch": 0.9787234042553191,
"grad_norm": 0.0717790350317955,
"learning_rate": 8.388018070853643e-06,
"loss": 0.63037109375,
"step": 46
},
{
"epoch": 1.0,
"grad_norm": 0.07482967525720596,
"learning_rate": 8.305704108364301e-06,
"loss": 0.615478515625,
"step": 47
},
{
"epoch": 1.0212765957446808,
"grad_norm": 0.07452995330095291,
"learning_rate": 8.22182477179437e-06,
"loss": 0.615234375,
"step": 48
},
{
"epoch": 1.0425531914893618,
"grad_norm": 0.09891754388809204,
"learning_rate": 8.136426859571014e-06,
"loss": 0.63916015625,
"step": 49
},
{
"epoch": 1.0638297872340425,
"grad_norm": 0.0689992755651474,
"learning_rate": 8.049558017373593e-06,
"loss": 0.61376953125,
"step": 50
},
{
"epoch": 1.0851063829787233,
"grad_norm": 0.7521502375602722,
"learning_rate": 7.961266711550922e-06,
"loss": 0.59326171875,
"step": 51
},
{
"epoch": 1.1063829787234043,
"grad_norm": 0.12467394024133682,
"learning_rate": 7.871602202080656e-06,
"loss": 0.632080078125,
"step": 52
},
{
"epoch": 1.127659574468085,
"grad_norm": 0.10193628817796707,
"learning_rate": 7.78061451508588e-06,
"loss": 0.621826171875,
"step": 53
},
{
"epoch": 1.148936170212766,
"grad_norm": 0.08595224469900131,
"learning_rate": 7.688354414924266e-06,
"loss": 0.6337890625,
"step": 54
},
{
"epoch": 1.1702127659574468,
"grad_norm": 0.06556966155767441,
"learning_rate": 7.594873375865336e-06,
"loss": 0.612060546875,
"step": 55
},
{
"epoch": 1.1914893617021276,
"grad_norm": 0.06449580192565918,
"learning_rate": 7.500223553371642e-06,
"loss": 0.587646484375,
"step": 56
},
{
"epoch": 1.2127659574468086,
"grad_norm": 0.17886410653591156,
"learning_rate": 7.404457754999913e-06,
"loss": 0.6162109375,
"step": 57
},
{
"epoch": 1.2127659574468086,
"eval_loss": 0.622802734375,
"eval_runtime": 0.9118,
"eval_samples_per_second": 8.774,
"eval_steps_per_second": 1.097,
"step": 57
},
{
"epoch": 1.2340425531914894,
"grad_norm": 0.1568862795829773,
"learning_rate": 7.307629410938364e-06,
"loss": 0.637451171875,
"step": 58
},
{
"epoch": 1.2553191489361701,
"grad_norm": 0.06442597508430481,
"learning_rate": 7.20979254419662e-06,
"loss": 0.599609375,
"step": 59
},
{
"epoch": 1.2765957446808511,
"grad_norm": 0.06344356387853622,
"learning_rate": 7.11100174046491e-06,
"loss": 0.596923828125,
"step": 60
},
{
"epoch": 1.297872340425532,
"grad_norm": 0.06211620196700096,
"learning_rate": 7.011312117659303e-06,
"loss": 0.599365234375,
"step": 61
},
{
"epoch": 1.3191489361702127,
"grad_norm": 0.06851235032081604,
"learning_rate": 6.910779295170017e-06,
"loss": 0.627197265625,
"step": 62
},
{
"epoch": 1.3404255319148937,
"grad_norm": 0.07076431065797806,
"learning_rate": 6.809459362829941e-06,
"loss": 0.56201171875,
"step": 63
},
{
"epoch": 1.3617021276595744,
"grad_norm": 0.062243252992630005,
"learning_rate": 6.707408849620683e-06,
"loss": 0.6279296875,
"step": 64
},
{
"epoch": 1.3829787234042552,
"grad_norm": 0.1926475316286087,
"learning_rate": 6.604684692133597e-06,
"loss": 0.65380859375,
"step": 65
},
{
"epoch": 1.4042553191489362,
"grad_norm": 0.06368491053581238,
"learning_rate": 6.501344202803415e-06,
"loss": 0.595947265625,
"step": 66
},
{
"epoch": 1.425531914893617,
"grad_norm": 0.06680840253829956,
"learning_rate": 6.397445037932167e-06,
"loss": 0.59033203125,
"step": 67
},
{
"epoch": 1.4468085106382977,
"grad_norm": 0.07508081942796707,
"learning_rate": 6.293045165521249e-06,
"loss": 0.609375,
"step": 68
},
{
"epoch": 1.4680851063829787,
"grad_norm": 0.06227220967411995,
"learning_rate": 6.188202832929607e-06,
"loss": 0.580322265625,
"step": 69
},
{
"epoch": 1.4893617021276595,
"grad_norm": 0.06462941318750381,
"learning_rate": 6.0829765343760376e-06,
"loss": 0.5986328125,
"step": 70
},
{
"epoch": 1.5106382978723403,
"grad_norm": 0.07289247214794159,
"learning_rate": 5.977424978303762e-06,
"loss": 0.576171875,
"step": 71
},
{
"epoch": 1.5319148936170213,
"grad_norm": 0.08890023827552795,
"learning_rate": 5.871607054625497e-06,
"loss": 0.6259765625,
"step": 72
},
{
"epoch": 1.5531914893617023,
"grad_norm": 0.07831184566020966,
"learning_rate": 5.765581801867254e-06,
"loss": 0.5927734375,
"step": 73
},
{
"epoch": 1.574468085106383,
"grad_norm": 0.07617679238319397,
"learning_rate": 5.659408374229244e-06,
"loss": 0.574951171875,
"step": 74
},
{
"epoch": 1.5957446808510638,
"grad_norm": 0.0626956969499588,
"learning_rate": 5.553146008582232e-06,
"loss": 0.56689453125,
"step": 75
},
{
"epoch": 1.6170212765957448,
"grad_norm": 0.06204919144511223,
"learning_rate": 5.446853991417771e-06,
"loss": 0.6123046875,
"step": 76
},
{
"epoch": 1.6382978723404256,
"grad_norm": 0.06160138547420502,
"learning_rate": 5.340591625770758e-06,
"loss": 0.6025390625,
"step": 77
},
{
"epoch": 1.6595744680851063,
"grad_norm": 0.11200636625289917,
"learning_rate": 5.234418198132748e-06,
"loss": 0.57666015625,
"step": 78
},
{
"epoch": 1.6808510638297873,
"grad_norm": 0.06134967878460884,
"learning_rate": 5.1283929453745055e-06,
"loss": 0.60498046875,
"step": 79
},
{
"epoch": 1.702127659574468,
"grad_norm": 0.06297880411148071,
"learning_rate": 5.02257502169624e-06,
"loss": 0.62060546875,
"step": 80
},
{
"epoch": 1.7234042553191489,
"grad_norm": 0.06980058550834656,
"learning_rate": 4.9170234656239655e-06,
"loss": 0.611083984375,
"step": 81
},
{
"epoch": 1.7446808510638299,
"grad_norm": 0.06381814926862717,
"learning_rate": 4.811797167070393e-06,
"loss": 0.60498046875,
"step": 82
},
{
"epoch": 1.7659574468085106,
"grad_norm": 0.2403756082057953,
"learning_rate": 4.706954834478753e-06,
"loss": 0.59375,
"step": 83
},
{
"epoch": 1.7872340425531914,
"grad_norm": 0.06059819459915161,
"learning_rate": 4.602554962067836e-06,
"loss": 0.60546875,
"step": 84
},
{
"epoch": 1.8085106382978724,
"grad_norm": 0.06093069911003113,
"learning_rate": 4.4986557971965865e-06,
"loss": 0.584716796875,
"step": 85
},
{
"epoch": 1.8085106382978724,
"eval_loss": 0.6068115234375,
"eval_runtime": 0.9222,
"eval_samples_per_second": 8.675,
"eval_steps_per_second": 1.084,
"step": 85
},
{
"epoch": 1.8297872340425532,
"grad_norm": 0.06800687313079834,
"learning_rate": 4.395315307866404e-06,
"loss": 0.642822265625,
"step": 86
},
{
"epoch": 1.851063829787234,
"grad_norm": 0.06103246659040451,
"learning_rate": 4.2925911503793205e-06,
"loss": 0.58251953125,
"step": 87
},
{
"epoch": 1.872340425531915,
"grad_norm": 0.061805445700883865,
"learning_rate": 4.19054063717006e-06,
"loss": 0.58056640625,
"step": 88
},
{
"epoch": 1.8936170212765957,
"grad_norm": 0.07350873202085495,
"learning_rate": 4.089220704829986e-06,
"loss": 0.554443359375,
"step": 89
},
{
"epoch": 1.9148936170212765,
"grad_norm": 0.06171874329447746,
"learning_rate": 3.988687882340698e-06,
"loss": 0.5888671875,
"step": 90
},
{
"epoch": 1.9361702127659575,
"grad_norm": 0.262273371219635,
"learning_rate": 3.888998259535092e-06,
"loss": 0.55419921875,
"step": 91
},
{
"epoch": 1.9574468085106385,
"grad_norm": 0.1396542489528656,
"learning_rate": 3.790207455803381e-06,
"loss": 0.6015625,
"step": 92
},
{
"epoch": 1.978723404255319,
"grad_norm": 0.06226907670497894,
"learning_rate": 3.692370589061639e-06,
"loss": 0.599365234375,
"step": 93
},
{
"epoch": 2.0,
"grad_norm": 0.06341912597417831,
"learning_rate": 3.595542245000089e-06,
"loss": 0.5810546875,
"step": 94
},
{
"epoch": 2.021276595744681,
"grad_norm": 0.06388843804597855,
"learning_rate": 3.499776446628361e-06,
"loss": 0.584716796875,
"step": 95
},
{
"epoch": 2.0425531914893615,
"grad_norm": 0.07137155532836914,
"learning_rate": 3.4051266241346658e-06,
"loss": 0.60986328125,
"step": 96
},
{
"epoch": 2.0638297872340425,
"grad_norm": 0.0604974739253521,
"learning_rate": 3.3116455850757343e-06,
"loss": 0.587890625,
"step": 97
},
{
"epoch": 2.0851063829787235,
"grad_norm": 8.030447006225586,
"learning_rate": 3.2193854849141204e-06,
"loss": 0.612548828125,
"step": 98
},
{
"epoch": 2.106382978723404,
"grad_norm": 0.09623796492815018,
"learning_rate": 3.1283977979193458e-06,
"loss": 0.60302734375,
"step": 99
},
{
"epoch": 2.127659574468085,
"grad_norm": 0.07766978442668915,
"learning_rate": 3.0387332884490806e-06,
"loss": 0.598388671875,
"step": 100
},
{
"epoch": 2.148936170212766,
"grad_norm": 0.06870637089014053,
"learning_rate": 2.9504419826264116e-06,
"loss": 0.607666015625,
"step": 101
},
{
"epoch": 2.1702127659574466,
"grad_norm": 0.060668252408504486,
"learning_rate": 2.8635731404289895e-06,
"loss": 0.5888671875,
"step": 102
},
{
"epoch": 2.1914893617021276,
"grad_norm": 0.06026003509759903,
"learning_rate": 2.7781752282056328e-06,
"loss": 0.566162109375,
"step": 103
},
{
"epoch": 2.2127659574468086,
"grad_norm": 0.08196396380662918,
"learning_rate": 2.6942958916356997e-06,
"loss": 0.59326171875,
"step": 104
},
{
"epoch": 2.2340425531914896,
"grad_norm": 0.08349911868572235,
"learning_rate": 2.6119819291463594e-06,
"loss": 0.61376953125,
"step": 105
},
{
"epoch": 2.25531914893617,
"grad_norm": 0.06174217164516449,
"learning_rate": 2.531279265802538e-06,
"loss": 0.577880859375,
"step": 106
},
{
"epoch": 2.276595744680851,
"grad_norm": 0.060782574117183685,
"learning_rate": 2.4522329276841664e-06,
"loss": 0.5771484375,
"step": 107
},
{
"epoch": 2.297872340425532,
"grad_norm": 0.059110283851623535,
"learning_rate": 2.374887016764961e-06,
"loss": 0.5810546875,
"step": 108
},
{
"epoch": 2.3191489361702127,
"grad_norm": 0.06728767603635788,
"learning_rate": 2.299284686306823e-06,
"loss": 0.607177734375,
"step": 109
},
{
"epoch": 2.3404255319148937,
"grad_norm": 0.06625807285308838,
"learning_rate": 2.2254681167835123e-06,
"loss": 0.544189453125,
"step": 110
},
{
"epoch": 2.3617021276595747,
"grad_norm": 0.060310665518045425,
"learning_rate": 2.153478492347097e-06,
"loss": 0.6103515625,
"step": 111
},
{
"epoch": 2.382978723404255,
"grad_norm": 0.07253512740135193,
"learning_rate": 2.083355977850252e-06,
"loss": 0.634033203125,
"step": 112
},
{
"epoch": 2.404255319148936,
"grad_norm": 0.061543628573417664,
"learning_rate": 2.0151396964372642e-06,
"loss": 0.579345703125,
"step": 113
},
{
"epoch": 2.404255319148936,
"eval_loss": 0.6005859375,
"eval_runtime": 0.9332,
"eval_samples_per_second": 8.572,
"eval_steps_per_second": 1.072,
"step": 113
},
{
"epoch": 2.425531914893617,
"grad_norm": 0.0641883984208107,
"learning_rate": 1.94886770771623e-06,
"loss": 0.57421875,
"step": 114
},
{
"epoch": 2.4468085106382977,
"grad_norm": 0.07023778557777405,
"learning_rate": 1.8845769865246256e-06,
"loss": 0.591064453125,
"step": 115
},
{
"epoch": 2.4680851063829787,
"grad_norm": 0.06087420508265495,
"learning_rate": 1.822303402300099e-06,
"loss": 0.564208984375,
"step": 116
},
{
"epoch": 2.4893617021276597,
"grad_norm": 0.06413070857524872,
"learning_rate": 1.7620816990679975e-06,
"loss": 0.583740234375,
"step": 117
},
{
"epoch": 2.5106382978723403,
"grad_norm": 0.06855274736881256,
"learning_rate": 1.703945476056778e-06,
"loss": 0.557861328125,
"step": 118
},
{
"epoch": 2.5319148936170213,
"grad_norm": 0.07735947519540787,
"learning_rate": 1.6479271689521504e-06,
"loss": 0.613525390625,
"step": 119
},
{
"epoch": 2.5531914893617023,
"grad_norm": 0.06765682250261307,
"learning_rate": 1.5940580318003663e-06,
"loss": 0.577392578125,
"step": 120
},
{
"epoch": 2.574468085106383,
"grad_norm": 0.07223811745643616,
"learning_rate": 1.5423681195707997e-06,
"loss": 0.55908203125,
"step": 121
},
{
"epoch": 2.595744680851064,
"grad_norm": 0.06124420091509819,
"learning_rate": 1.4928862713874996e-06,
"loss": 0.552490234375,
"step": 122
},
{
"epoch": 2.617021276595745,
"grad_norm": 0.061064235866069794,
"learning_rate": 1.4456400944391147e-06,
"loss": 0.60009765625,
"step": 123
},
{
"epoch": 2.6382978723404253,
"grad_norm": 0.059814613312482834,
"learning_rate": 1.4006559485761282e-06,
"loss": 0.59033203125,
"step": 124
},
{
"epoch": 2.6595744680851063,
"grad_norm": 0.08451995998620987,
"learning_rate": 1.3579589316040297e-06,
"loss": 0.564208984375,
"step": 125
},
{
"epoch": 2.6808510638297873,
"grad_norm": 0.061760902404785156,
"learning_rate": 1.3175728652806047e-06,
"loss": 0.594482421875,
"step": 126
},
{
"epoch": 2.702127659574468,
"grad_norm": 0.061048850417137146,
"learning_rate": 1.2795202820251665e-06,
"loss": 0.609375,
"step": 127
},
{
"epoch": 2.723404255319149,
"grad_norm": 0.06953231245279312,
"learning_rate": 1.2438224123471442e-06,
"loss": 0.598876953125,
"step": 128
},
{
"epoch": 2.74468085106383,
"grad_norm": 0.05982961133122444,
"learning_rate": 1.210499173001039e-06,
"loss": 0.59521484375,
"step": 129
},
{
"epoch": 2.7659574468085104,
"grad_norm": 0.0727211982011795,
"learning_rate": 1.1795691558743535e-06,
"loss": 0.581787109375,
"step": 130
},
{
"epoch": 2.7872340425531914,
"grad_norm": 0.0596589520573616,
"learning_rate": 1.1510496176147085e-06,
"loss": 0.59716796875,
"step": 131
},
{
"epoch": 2.8085106382978724,
"grad_norm": 0.05985628813505173,
"learning_rate": 1.1249564700019127e-06,
"loss": 0.57421875,
"step": 132
},
{
"epoch": 2.829787234042553,
"grad_norm": 0.06684412807226181,
"learning_rate": 1.1013042710703767e-06,
"loss": 0.634521484375,
"step": 133
},
{
"epoch": 2.851063829787234,
"grad_norm": 0.0605284757912159,
"learning_rate": 1.0801062169868107e-06,
"loss": 0.57470703125,
"step": 134
},
{
"epoch": 2.872340425531915,
"grad_norm": 0.06104891747236252,
"learning_rate": 1.0613741346877498e-06,
"loss": 0.57080078125,
"step": 135
},
{
"epoch": 2.8936170212765955,
"grad_norm": 0.0715995654463768,
"learning_rate": 1.0451184752809978e-06,
"loss": 0.5458984375,
"step": 136
},
{
"epoch": 2.9148936170212765,
"grad_norm": 0.06113986298441887,
"learning_rate": 1.0313483082146918e-06,
"loss": 0.58056640625,
"step": 137
},
{
"epoch": 2.9361702127659575,
"grad_norm": 0.0903206393122673,
"learning_rate": 1.0200713162172245e-06,
"loss": 0.5439453125,
"step": 138
},
{
"epoch": 2.9574468085106385,
"grad_norm": 0.10972226411104202,
"learning_rate": 1.0112937910108494e-06,
"loss": 0.593505859375,
"step": 139
},
{
"epoch": 2.978723404255319,
"grad_norm": 0.061755139380693436,
"learning_rate": 1.005020629801373e-06,
"loss": 0.591064453125,
"step": 140
},
{
"epoch": 3.0,
"grad_norm": 0.0636168122291565,
"learning_rate": 1.0012553325458768e-06,
"loss": 0.574951171875,
"step": 141
},
{
"epoch": 3.0,
"eval_loss": 0.59783935546875,
"eval_runtime": 0.9275,
"eval_samples_per_second": 8.625,
"eval_steps_per_second": 1.078,
"step": 141
}
],
"logging_steps": 1.0,
"max_steps": 141,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.173363486029775e+18,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}