zgrgr's picture
Upload model files with Nebius access
37531b1 verified
Raw
History Blame Contribute Delete
29 kB
{
"best_metric": 0.971350908279419,
"best_model_checkpoint": "./fine_tuned_models/health/Llama-3.1-8B-Instruct/checkpoint-2500",
"epoch": 2.5669135802469136,
"eval_steps": 100,
"global_step": 2600,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.019753086419753086,
"grad_norm": 1.1160211563110352,
"learning_rate": 1.9736842105263157e-06,
"loss": 2.0627,
"step": 20
},
{
"epoch": 0.03950617283950617,
"grad_norm": 1.0905706882476807,
"learning_rate": 3.9473684210526315e-06,
"loss": 2.0246,
"step": 40
},
{
"epoch": 0.05925925925925926,
"grad_norm": 0.9707510471343994,
"learning_rate": 5.921052631578948e-06,
"loss": 1.9243,
"step": 60
},
{
"epoch": 0.07901234567901234,
"grad_norm": 1.0528677701950073,
"learning_rate": 7.894736842105263e-06,
"loss": 1.6172,
"step": 80
},
{
"epoch": 0.09876543209876543,
"grad_norm": 0.7791302800178528,
"learning_rate": 9.868421052631579e-06,
"loss": 1.3386,
"step": 100
},
{
"epoch": 0.09876543209876543,
"eval_loss": 1.2289670705795288,
"eval_runtime": 404.6369,
"eval_samples_per_second": 4.448,
"eval_steps_per_second": 1.112,
"step": 100
},
{
"epoch": 0.11851851851851852,
"grad_norm": 0.6323535442352295,
"learning_rate": 1.1842105263157895e-05,
"loss": 1.1669,
"step": 120
},
{
"epoch": 0.1382716049382716,
"grad_norm": 0.6384269595146179,
"learning_rate": 1.3815789473684211e-05,
"loss": 1.1764,
"step": 140
},
{
"epoch": 0.1580246913580247,
"grad_norm": 0.6977917551994324,
"learning_rate": 1.5789473684210526e-05,
"loss": 1.1308,
"step": 160
},
{
"epoch": 0.17777777777777778,
"grad_norm": 0.6905924081802368,
"learning_rate": 1.7763157894736842e-05,
"loss": 1.1127,
"step": 180
},
{
"epoch": 0.19753086419753085,
"grad_norm": 0.7211576700210571,
"learning_rate": 1.9736842105263158e-05,
"loss": 1.1204,
"step": 200
},
{
"epoch": 0.19753086419753085,
"eval_loss": 1.10204017162323,
"eval_runtime": 403.0411,
"eval_samples_per_second": 4.466,
"eval_steps_per_second": 1.117,
"step": 200
},
{
"epoch": 0.21728395061728395,
"grad_norm": 0.7831864953041077,
"learning_rate": 2.1710526315789474e-05,
"loss": 1.0875,
"step": 220
},
{
"epoch": 0.23703703703703705,
"grad_norm": 0.8442113399505615,
"learning_rate": 2.368421052631579e-05,
"loss": 1.0855,
"step": 240
},
{
"epoch": 0.25679012345679014,
"grad_norm": 0.8692957162857056,
"learning_rate": 2.5657894736842107e-05,
"loss": 1.0797,
"step": 260
},
{
"epoch": 0.2765432098765432,
"grad_norm": 0.8785028457641602,
"learning_rate": 2.7631578947368423e-05,
"loss": 1.1142,
"step": 280
},
{
"epoch": 0.2962962962962963,
"grad_norm": 0.8870799541473389,
"learning_rate": 2.9605263157894735e-05,
"loss": 1.0707,
"step": 300
},
{
"epoch": 0.2962962962962963,
"eval_loss": 1.074904203414917,
"eval_runtime": 403.0664,
"eval_samples_per_second": 4.466,
"eval_steps_per_second": 1.116,
"step": 300
},
{
"epoch": 0.3160493827160494,
"grad_norm": 0.9721025228500366,
"learning_rate": 2.9997461206762896e-05,
"loss": 1.0471,
"step": 320
},
{
"epoch": 0.3358024691358025,
"grad_norm": 0.9425962567329407,
"learning_rate": 2.998714883211034e-05,
"loss": 1.0614,
"step": 340
},
{
"epoch": 0.35555555555555557,
"grad_norm": 1.0400207042694092,
"learning_rate": 2.9968909651554313e-05,
"loss": 1.0386,
"step": 360
},
{
"epoch": 0.37530864197530867,
"grad_norm": 1.033016562461853,
"learning_rate": 2.994275331192262e-05,
"loss": 1.0591,
"step": 380
},
{
"epoch": 0.3950617283950617,
"grad_norm": 1.202338695526123,
"learning_rate": 2.9908693647482852e-05,
"loss": 1.081,
"step": 400
},
{
"epoch": 0.3950617283950617,
"eval_loss": 1.05765700340271,
"eval_runtime": 402.7051,
"eval_samples_per_second": 4.47,
"eval_steps_per_second": 1.117,
"step": 400
},
{
"epoch": 0.4148148148148148,
"grad_norm": 1.0287129878997803,
"learning_rate": 2.9866748672625354e-05,
"loss": 1.1013,
"step": 420
},
{
"epoch": 0.4345679012345679,
"grad_norm": 1.114308476448059,
"learning_rate": 2.9816940572335275e-05,
"loss": 1.0684,
"step": 440
},
{
"epoch": 0.454320987654321,
"grad_norm": 1.1122310161590576,
"learning_rate": 2.9759295690458793e-05,
"loss": 1.0675,
"step": 460
},
{
"epoch": 0.4740740740740741,
"grad_norm": 1.0627741813659668,
"learning_rate": 2.9693844515769658e-05,
"loss": 1.0327,
"step": 480
},
{
"epoch": 0.49382716049382713,
"grad_norm": 1.0726803541183472,
"learning_rate": 2.9620621665843482e-05,
"loss": 1.0413,
"step": 500
},
{
"epoch": 0.49382716049382713,
"eval_loss": 1.0474056005477905,
"eval_runtime": 403.0908,
"eval_samples_per_second": 4.465,
"eval_steps_per_second": 1.116,
"step": 500
},
{
"epoch": 0.5135802469135803,
"grad_norm": 1.2839173078536987,
"learning_rate": 2.953966586874827e-05,
"loss": 1.0507,
"step": 520
},
{
"epoch": 0.5333333333333333,
"grad_norm": 1.0455371141433716,
"learning_rate": 2.9451019942560854e-05,
"loss": 1.0484,
"step": 540
},
{
"epoch": 0.5530864197530864,
"grad_norm": 1.0756592750549316,
"learning_rate": 2.9354730772720152e-05,
"loss": 1.0612,
"step": 560
},
{
"epoch": 0.5728395061728395,
"grad_norm": 1.1546605825424194,
"learning_rate": 2.9250849287229115e-05,
"loss": 1.0338,
"step": 580
},
{
"epoch": 0.5925925925925926,
"grad_norm": 1.062068223953247,
"learning_rate": 2.9139430429718557e-05,
"loss": 1.05,
"step": 600
},
{
"epoch": 0.5925925925925926,
"eval_loss": 1.0370533466339111,
"eval_runtime": 402.7813,
"eval_samples_per_second": 4.469,
"eval_steps_per_second": 1.117,
"step": 600
},
{
"epoch": 0.6123456790123457,
"grad_norm": 1.0931472778320312,
"learning_rate": 2.90205331303871e-05,
"loss": 1.0282,
"step": 620
},
{
"epoch": 0.6320987654320988,
"grad_norm": 1.1314401626586914,
"learning_rate": 2.889422027483259e-05,
"loss": 1.0185,
"step": 640
},
{
"epoch": 0.6518518518518519,
"grad_norm": 1.1147228479385376,
"learning_rate": 2.876055867079146e-05,
"loss": 1.0552,
"step": 660
},
{
"epoch": 0.671604938271605,
"grad_norm": 1.2712368965148926,
"learning_rate": 2.8619619012803674e-05,
"loss": 1.0241,
"step": 680
},
{
"epoch": 0.691358024691358,
"grad_norm": 1.1172308921813965,
"learning_rate": 2.847147584482188e-05,
"loss": 1.018,
"step": 700
},
{
"epoch": 0.691358024691358,
"eval_loss": 1.0282899141311646,
"eval_runtime": 403.0768,
"eval_samples_per_second": 4.466,
"eval_steps_per_second": 1.116,
"step": 700
},
{
"epoch": 0.7111111111111111,
"grad_norm": 1.1631219387054443,
"learning_rate": 2.8316207520784622e-05,
"loss": 1.037,
"step": 720
},
{
"epoch": 0.7308641975308642,
"grad_norm": 1.0679621696472168,
"learning_rate": 2.81538961631744e-05,
"loss": 0.9998,
"step": 740
},
{
"epoch": 0.7506172839506173,
"grad_norm": 1.098596215248108,
"learning_rate": 2.7984627619582507e-05,
"loss": 1.0164,
"step": 760
},
{
"epoch": 0.7703703703703704,
"grad_norm": 1.1393965482711792,
"learning_rate": 2.7808491417303672e-05,
"loss": 1.0407,
"step": 780
},
{
"epoch": 0.7901234567901234,
"grad_norm": 1.34330153465271,
"learning_rate": 2.7625580715984452e-05,
"loss": 1.0432,
"step": 800
},
{
"epoch": 0.7901234567901234,
"eval_loss": 1.0187339782714844,
"eval_runtime": 402.8401,
"eval_samples_per_second": 4.468,
"eval_steps_per_second": 1.117,
"step": 800
},
{
"epoch": 0.8098765432098766,
"grad_norm": 1.1482850313186646,
"learning_rate": 2.7435992258350444e-05,
"loss": 1.0214,
"step": 820
},
{
"epoch": 0.8296296296296296,
"grad_norm": 1.0984679460525513,
"learning_rate": 2.7239826319038413e-05,
"loss": 1.0104,
"step": 840
},
{
"epoch": 0.8493827160493828,
"grad_norm": 1.1276164054870605,
"learning_rate": 2.703718665156033e-05,
"loss": 1.0151,
"step": 860
},
{
"epoch": 0.8691358024691358,
"grad_norm": 1.1957815885543823,
"learning_rate": 2.6828180433427437e-05,
"loss": 1.0254,
"step": 880
},
{
"epoch": 0.8888888888888888,
"grad_norm": 1.1888211965560913,
"learning_rate": 2.6612918209463323e-05,
"loss": 1.0056,
"step": 900
},
{
"epoch": 0.8888888888888888,
"eval_loss": 1.0113353729248047,
"eval_runtime": 403.2634,
"eval_samples_per_second": 4.464,
"eval_steps_per_second": 1.116,
"step": 900
},
{
"epoch": 0.908641975308642,
"grad_norm": 1.1143324375152588,
"learning_rate": 2.6391513833336013e-05,
"loss": 1.038,
"step": 920
},
{
"epoch": 0.928395061728395,
"grad_norm": 1.1294788122177124,
"learning_rate": 2.616408440733997e-05,
"loss": 1.0346,
"step": 940
},
{
"epoch": 0.9481481481481482,
"grad_norm": 1.1774975061416626,
"learning_rate": 2.5930750220459893e-05,
"loss": 1.004,
"step": 960
},
{
"epoch": 0.9679012345679012,
"grad_norm": 1.1493123769760132,
"learning_rate": 2.569163468474906e-05,
"loss": 0.9974,
"step": 980
},
{
"epoch": 0.9876543209876543,
"grad_norm": 1.2377318143844604,
"learning_rate": 2.5446864270055825e-05,
"loss": 0.9987,
"step": 1000
},
{
"epoch": 0.9876543209876543,
"eval_loss": 1.0076097249984741,
"eval_runtime": 402.948,
"eval_samples_per_second": 4.467,
"eval_steps_per_second": 1.117,
"step": 1000
},
{
"epoch": 1.0069135802469136,
"grad_norm": 1.225941777229309,
"learning_rate": 2.5196568437132855e-05,
"loss": 0.9939,
"step": 1020
},
{
"epoch": 1.0266666666666666,
"grad_norm": 1.240697979927063,
"learning_rate": 2.4940879569164453e-05,
"loss": 0.9806,
"step": 1040
},
{
"epoch": 1.0464197530864197,
"grad_norm": 1.2726426124572754,
"learning_rate": 2.467993290174819e-05,
"loss": 0.9758,
"step": 1060
},
{
"epoch": 1.066172839506173,
"grad_norm": 1.3213516473770142,
"learning_rate": 2.4413866451367836e-05,
"loss": 0.9822,
"step": 1080
},
{
"epoch": 1.085925925925926,
"grad_norm": 1.2369683980941772,
"learning_rate": 2.414282094239555e-05,
"loss": 0.9467,
"step": 1100
},
{
"epoch": 1.085925925925926,
"eval_loss": 1.0044056177139282,
"eval_runtime": 402.972,
"eval_samples_per_second": 4.467,
"eval_steps_per_second": 1.117,
"step": 1100
},
{
"epoch": 1.105679012345679,
"grad_norm": 1.1692577600479126,
"learning_rate": 2.386693973266173e-05,
"loss": 0.9586,
"step": 1120
},
{
"epoch": 1.125432098765432,
"grad_norm": 1.1815599203109741,
"learning_rate": 2.3586368737632124e-05,
"loss": 0.9711,
"step": 1140
},
{
"epoch": 1.145185185185185,
"grad_norm": 1.2383053302764893,
"learning_rate": 2.3301256353232112e-05,
"loss": 0.9668,
"step": 1160
},
{
"epoch": 1.1649382716049383,
"grad_norm": 1.4748594760894775,
"learning_rate": 2.3011753377359084e-05,
"loss": 0.977,
"step": 1180
},
{
"epoch": 1.1846913580246914,
"grad_norm": 1.3367607593536377,
"learning_rate": 2.2718012930124407e-05,
"loss": 0.9461,
"step": 1200
},
{
"epoch": 1.1846913580246914,
"eval_loss": 0.9985090494155884,
"eval_runtime": 402.6419,
"eval_samples_per_second": 4.47,
"eval_steps_per_second": 1.118,
"step": 1200
},
{
"epoch": 1.2044444444444444,
"grad_norm": 1.3120101690292358,
"learning_rate": 2.2420190372867144e-05,
"loss": 0.9728,
"step": 1220
},
{
"epoch": 1.2241975308641975,
"grad_norm": 1.4451560974121094,
"learning_rate": 2.2118443225982365e-05,
"loss": 0.962,
"step": 1240
},
{
"epoch": 1.2439506172839505,
"grad_norm": 1.2705769538879395,
"learning_rate": 2.1812931085607537e-05,
"loss": 0.9425,
"step": 1260
},
{
"epoch": 1.2637037037037038,
"grad_norm": 1.3269940614700317,
"learning_rate": 2.1503815539211034e-05,
"loss": 0.9519,
"step": 1280
},
{
"epoch": 1.2834567901234568,
"grad_norm": 1.2251733541488647,
"learning_rate": 2.119126008012741e-05,
"loss": 0.9671,
"step": 1300
},
{
"epoch": 1.2834567901234568,
"eval_loss": 0.9977313280105591,
"eval_runtime": 402.6952,
"eval_samples_per_second": 4.47,
"eval_steps_per_second": 1.117,
"step": 1300
},
{
"epoch": 1.3032098765432099,
"grad_norm": 1.3956445455551147,
"learning_rate": 2.0875430021084665e-05,
"loss": 0.9742,
"step": 1320
},
{
"epoch": 1.322962962962963,
"grad_norm": 1.2852596044540405,
"learning_rate": 2.0556492406769176e-05,
"loss": 0.9635,
"step": 1340
},
{
"epoch": 1.342716049382716,
"grad_norm": 1.3903273344039917,
"learning_rate": 2.0234615925474648e-05,
"loss": 0.9622,
"step": 1360
},
{
"epoch": 1.3624691358024692,
"grad_norm": 1.457078456878662,
"learning_rate": 1.9909970819881708e-05,
"loss": 0.9833,
"step": 1380
},
{
"epoch": 1.3822222222222222,
"grad_norm": 1.2986372709274292,
"learning_rate": 1.9582728797015385e-05,
"loss": 0.9495,
"step": 1400
},
{
"epoch": 1.3822222222222222,
"eval_loss": 0.9925122857093811,
"eval_runtime": 402.5025,
"eval_samples_per_second": 4.472,
"eval_steps_per_second": 1.118,
"step": 1400
},
{
"epoch": 1.4019753086419753,
"grad_norm": 1.342713475227356,
"learning_rate": 1.9253062937428073e-05,
"loss": 0.9609,
"step": 1420
},
{
"epoch": 1.4217283950617283,
"grad_norm": 1.2822914123535156,
"learning_rate": 1.892114760365605e-05,
"loss": 0.9658,
"step": 1440
},
{
"epoch": 1.4414814814814814,
"grad_norm": 1.331895351409912,
"learning_rate": 1.8587158347997932e-05,
"loss": 0.9769,
"step": 1460
},
{
"epoch": 1.4612345679012346,
"grad_norm": 1.3801404237747192,
"learning_rate": 1.8251271819663863e-05,
"loss": 0.98,
"step": 1480
},
{
"epoch": 1.4809876543209877,
"grad_norm": 1.337031364440918,
"learning_rate": 1.7913665671344526e-05,
"loss": 0.9716,
"step": 1500
},
{
"epoch": 1.4809876543209877,
"eval_loss": 0.9894294738769531,
"eval_runtime": 402.6051,
"eval_samples_per_second": 4.471,
"eval_steps_per_second": 1.118,
"step": 1500
},
{
"epoch": 1.5007407407407407,
"grad_norm": 1.551279067993164,
"learning_rate": 1.7574518465249413e-05,
"loss": 0.9772,
"step": 1520
},
{
"epoch": 1.520493827160494,
"grad_norm": 1.3463525772094727,
"learning_rate": 1.7234009578664066e-05,
"loss": 0.9477,
"step": 1540
},
{
"epoch": 1.5402469135802468,
"grad_norm": 1.3253049850463867,
"learning_rate": 1.6892319109076183e-05,
"loss": 0.9641,
"step": 1560
},
{
"epoch": 1.56,
"grad_norm": 1.4334008693695068,
"learning_rate": 1.654962777892081e-05,
"loss": 0.9584,
"step": 1580
},
{
"epoch": 1.579753086419753,
"grad_norm": 1.412903904914856,
"learning_rate": 1.6206116839995033e-05,
"loss": 0.9779,
"step": 1600
},
{
"epoch": 1.579753086419753,
"eval_loss": 0.9848657846450806,
"eval_runtime": 402.5392,
"eval_samples_per_second": 4.472,
"eval_steps_per_second": 1.118,
"step": 1600
},
{
"epoch": 1.5995061728395061,
"grad_norm": 1.251621961593628,
"learning_rate": 1.5861967977592642e-05,
"loss": 0.942,
"step": 1620
},
{
"epoch": 1.6192592592592594,
"grad_norm": 1.3814697265625,
"learning_rate": 1.5517363214409528e-05,
"loss": 0.9469,
"step": 1640
},
{
"epoch": 1.6390123456790122,
"grad_norm": 1.388342022895813,
"learning_rate": 1.5172484814270635e-05,
"loss": 0.9716,
"step": 1660
},
{
"epoch": 1.6587654320987655,
"grad_norm": 1.318664312362671,
"learning_rate": 1.4827515185729368e-05,
"loss": 0.98,
"step": 1680
},
{
"epoch": 1.6785185185185185,
"grad_norm": 1.364259958267212,
"learning_rate": 1.4482636785590474e-05,
"loss": 0.9628,
"step": 1700
},
{
"epoch": 1.6785185185185185,
"eval_loss": 0.9820418357849121,
"eval_runtime": 402.744,
"eval_samples_per_second": 4.469,
"eval_steps_per_second": 1.117,
"step": 1700
},
{
"epoch": 1.6982716049382716,
"grad_norm": 1.346475601196289,
"learning_rate": 1.413803202240736e-05,
"loss": 0.995,
"step": 1720
},
{
"epoch": 1.7180246913580248,
"grad_norm": 1.350071907043457,
"learning_rate": 1.3793883160004971e-05,
"loss": 0.9792,
"step": 1740
},
{
"epoch": 1.7377777777777776,
"grad_norm": 1.3962644338607788,
"learning_rate": 1.3450372221079193e-05,
"loss": 0.9885,
"step": 1760
},
{
"epoch": 1.757530864197531,
"grad_norm": 1.4300681352615356,
"learning_rate": 1.3107680890923821e-05,
"loss": 0.9433,
"step": 1780
},
{
"epoch": 1.777283950617284,
"grad_norm": 1.604736566543579,
"learning_rate": 1.2765990421335937e-05,
"loss": 0.966,
"step": 1800
},
{
"epoch": 1.777283950617284,
"eval_loss": 0.9798233509063721,
"eval_runtime": 402.6875,
"eval_samples_per_second": 4.47,
"eval_steps_per_second": 1.117,
"step": 1800
},
{
"epoch": 1.797037037037037,
"grad_norm": 1.3228657245635986,
"learning_rate": 1.2425481534750591e-05,
"loss": 1.0006,
"step": 1820
},
{
"epoch": 1.8167901234567903,
"grad_norm": 1.5004771947860718,
"learning_rate": 1.2086334328655478e-05,
"loss": 0.9622,
"step": 1840
},
{
"epoch": 1.836543209876543,
"grad_norm": 1.412369966506958,
"learning_rate": 1.1748728180336137e-05,
"loss": 0.9764,
"step": 1860
},
{
"epoch": 1.8562962962962963,
"grad_norm": 1.4217263460159302,
"learning_rate": 1.141284165200207e-05,
"loss": 0.9396,
"step": 1880
},
{
"epoch": 1.8760493827160494,
"grad_norm": 1.3855938911437988,
"learning_rate": 1.1078852396343955e-05,
"loss": 0.9449,
"step": 1900
},
{
"epoch": 1.8760493827160494,
"eval_loss": 0.9764742255210876,
"eval_runtime": 402.9468,
"eval_samples_per_second": 4.467,
"eval_steps_per_second": 1.117,
"step": 1900
},
{
"epoch": 1.8958024691358024,
"grad_norm": 1.3269942998886108,
"learning_rate": 1.0746937062571928e-05,
"loss": 0.9488,
"step": 1920
},
{
"epoch": 1.9155555555555557,
"grad_norm": 1.3707290887832642,
"learning_rate": 1.0417271202984614e-05,
"loss": 0.9477,
"step": 1940
},
{
"epoch": 1.9353086419753085,
"grad_norm": 1.4749308824539185,
"learning_rate": 1.0090029180118293e-05,
"loss": 0.9367,
"step": 1960
},
{
"epoch": 1.9550617283950618,
"grad_norm": 1.537101149559021,
"learning_rate": 9.765384074525358e-06,
"loss": 0.919,
"step": 1980
},
{
"epoch": 1.9748148148148148,
"grad_norm": 1.251558780670166,
"learning_rate": 9.443507593230829e-06,
"loss": 0.9454,
"step": 2000
},
{
"epoch": 1.9748148148148148,
"eval_loss": 0.9748017191886902,
"eval_runtime": 403.0506,
"eval_samples_per_second": 4.466,
"eval_steps_per_second": 1.116,
"step": 2000
},
{
"epoch": 1.9945679012345678,
"grad_norm": 1.4743434190750122,
"learning_rate": 9.124569978915336e-06,
"loss": 0.9237,
"step": 2020
},
{
"epoch": 2.013827160493827,
"grad_norm": 1.2874201536178589,
"learning_rate": 8.808739919872588e-06,
"loss": 0.8969,
"step": 2040
},
{
"epoch": 2.0335802469135804,
"grad_norm": 1.4540894031524658,
"learning_rate": 8.496184460788969e-06,
"loss": 0.9179,
"step": 2060
},
{
"epoch": 2.0533333333333332,
"grad_norm": 1.5025060176849365,
"learning_rate": 8.187068914392464e-06,
"loss": 0.9091,
"step": 2080
},
{
"epoch": 2.0730864197530865,
"grad_norm": 1.4199432134628296,
"learning_rate": 7.881556774017635e-06,
"loss": 0.9209,
"step": 2100
},
{
"epoch": 2.0730864197530865,
"eval_loss": 0.9763918519020081,
"eval_runtime": 402.9594,
"eval_samples_per_second": 4.467,
"eval_steps_per_second": 1.117,
"step": 2100
},
{
"epoch": 2.0928395061728393,
"grad_norm": 1.5283966064453125,
"learning_rate": 7.579809627132857e-06,
"loss": 0.9488,
"step": 2120
},
{
"epoch": 2.1125925925925926,
"grad_norm": 1.4568904638290405,
"learning_rate": 7.281987069875591e-06,
"loss": 0.9094,
"step": 2140
},
{
"epoch": 2.132345679012346,
"grad_norm": 1.4240208864212036,
"learning_rate": 6.988246622640921e-06,
"loss": 0.9166,
"step": 2160
},
{
"epoch": 2.1520987654320987,
"grad_norm": 1.5284944772720337,
"learning_rate": 6.698743646767891e-06,
"loss": 0.9205,
"step": 2180
},
{
"epoch": 2.171851851851852,
"grad_norm": 1.4134441614151,
"learning_rate": 6.413631262367882e-06,
"loss": 0.9121,
"step": 2200
},
{
"epoch": 2.171851851851852,
"eval_loss": 0.9747745990753174,
"eval_runtime": 402.9155,
"eval_samples_per_second": 4.467,
"eval_steps_per_second": 1.117,
"step": 2200
},
{
"epoch": 2.1916049382716047,
"grad_norm": 1.4537668228149414,
"learning_rate": 6.1330602673382725e-06,
"loss": 0.8968,
"step": 2220
},
{
"epoch": 2.211358024691358,
"grad_norm": 1.4549959897994995,
"learning_rate": 5.857179057604451e-06,
"loss": 0.8984,
"step": 2240
},
{
"epoch": 2.2311111111111113,
"grad_norm": 1.5467361211776733,
"learning_rate": 5.586133548632161e-06,
"loss": 0.9044,
"step": 2260
},
{
"epoch": 2.250864197530864,
"grad_norm": 1.5347260236740112,
"learning_rate": 5.320067098251815e-06,
"loss": 0.9008,
"step": 2280
},
{
"epoch": 2.2706172839506173,
"grad_norm": 1.5415095090866089,
"learning_rate": 5.0591204308355465e-06,
"loss": 0.92,
"step": 2300
},
{
"epoch": 2.2706172839506173,
"eval_loss": 0.9742743372917175,
"eval_runtime": 402.5831,
"eval_samples_per_second": 4.471,
"eval_steps_per_second": 1.118,
"step": 2300
},
{
"epoch": 2.29037037037037,
"grad_norm": 1.4806352853775024,
"learning_rate": 4.803431562867145e-06,
"loss": 0.9074,
"step": 2320
},
{
"epoch": 2.3101234567901234,
"grad_norm": 1.5135067701339722,
"learning_rate": 4.5531357299441774e-06,
"loss": 0.9279,
"step": 2340
},
{
"epoch": 2.3298765432098767,
"grad_norm": 1.5284662246704102,
"learning_rate": 4.3083653152509434e-06,
"loss": 0.918,
"step": 2360
},
{
"epoch": 2.3496296296296295,
"grad_norm": 1.5032851696014404,
"learning_rate": 4.069249779540108e-06,
"loss": 0.8999,
"step": 2380
},
{
"epoch": 2.3693827160493828,
"grad_norm": 1.510326862335205,
"learning_rate": 3.835915592660032e-06,
"loss": 0.8842,
"step": 2400
},
{
"epoch": 2.3693827160493828,
"eval_loss": 0.9732682108879089,
"eval_runtime": 402.6779,
"eval_samples_per_second": 4.47,
"eval_steps_per_second": 1.118,
"step": 2400
},
{
"epoch": 2.389135802469136,
"grad_norm": 1.5141196250915527,
"learning_rate": 3.6084861666639856e-06,
"loss": 0.8984,
"step": 2420
},
{
"epoch": 2.408888888888889,
"grad_norm": 1.5734765529632568,
"learning_rate": 3.387081790536677e-06,
"loss": 0.9365,
"step": 2440
},
{
"epoch": 2.428641975308642,
"grad_norm": 1.4879003763198853,
"learning_rate": 3.171819566572563e-06,
"loss": 0.8829,
"step": 2460
},
{
"epoch": 2.448395061728395,
"grad_norm": 1.4807547330856323,
"learning_rate": 2.962813348439669e-06,
"loss": 0.9212,
"step": 2480
},
{
"epoch": 2.468148148148148,
"grad_norm": 1.492896556854248,
"learning_rate": 2.7601736809615883e-06,
"loss": 0.9079,
"step": 2500
},
{
"epoch": 2.468148148148148,
"eval_loss": 0.971350908279419,
"eval_runtime": 402.7891,
"eval_samples_per_second": 4.469,
"eval_steps_per_second": 1.117,
"step": 2500
},
{
"epoch": 2.487901234567901,
"grad_norm": 1.49791419506073,
"learning_rate": 2.564007741649559e-06,
"loss": 0.9271,
"step": 2520
},
{
"epoch": 2.5076543209876543,
"grad_norm": 1.5255753993988037,
"learning_rate": 2.374419284015552e-06,
"loss": 0.9105,
"step": 2540
},
{
"epoch": 2.5274074074074075,
"grad_norm": 1.4556204080581665,
"learning_rate": 2.191508582696329e-06,
"loss": 0.9169,
"step": 2560
},
{
"epoch": 2.5471604938271604,
"grad_norm": 1.5181186199188232,
"learning_rate": 2.0153723804174945e-06,
"loss": 0.8952,
"step": 2580
},
{
"epoch": 2.5669135802469136,
"grad_norm": 1.5350087881088257,
"learning_rate": 1.8461038368256027e-06,
"loss": 0.909,
"step": 2600
},
{
"epoch": 2.5669135802469136,
"eval_loss": 0.9715363383293152,
"eval_runtime": 402.7586,
"eval_samples_per_second": 4.469,
"eval_steps_per_second": 1.117,
"step": 2600
}
],
"logging_steps": 20,
"max_steps": 3036,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.8563300999472087e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}