Llama-3.1-8B-Instruct-kvkk-alpaca / trainer_state.json
zgrgr's picture
Upload model files with Nebius access
d465495 verified
Raw
History Blame
29 kB
{
"best_metric": 0.9180880188941956,
"best_model_checkpoint": "./fine_tuned_models/kvkk/Llama-3.1-8B-Instruct/checkpoint-2600",
"epoch": 2.5669135802469136,
"eval_steps": 100,
"global_step": 2600,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.019753086419753086,
"grad_norm": 1.1142268180847168,
"learning_rate": 1.9736842105263157e-06,
"loss": 2.0286,
"step": 20
},
{
"epoch": 0.03950617283950617,
"grad_norm": 1.1114156246185303,
"learning_rate": 3.9473684210526315e-06,
"loss": 2.012,
"step": 40
},
{
"epoch": 0.05925925925925926,
"grad_norm": 1.0126515626907349,
"learning_rate": 5.921052631578948e-06,
"loss": 1.8797,
"step": 60
},
{
"epoch": 0.07901234567901234,
"grad_norm": 1.0541017055511475,
"learning_rate": 7.894736842105263e-06,
"loss": 1.5698,
"step": 80
},
{
"epoch": 0.09876543209876543,
"grad_norm": 0.8761700391769409,
"learning_rate": 9.868421052631579e-06,
"loss": 1.2906,
"step": 100
},
{
"epoch": 0.09876543209876543,
"eval_loss": 1.1851595640182495,
"eval_runtime": 402.5327,
"eval_samples_per_second": 4.472,
"eval_steps_per_second": 1.118,
"step": 100
},
{
"epoch": 0.11851851851851852,
"grad_norm": 0.7023137211799622,
"learning_rate": 1.1842105263157895e-05,
"loss": 1.1435,
"step": 120
},
{
"epoch": 0.1382716049382716,
"grad_norm": 0.7056591510772705,
"learning_rate": 1.3815789473684211e-05,
"loss": 1.1222,
"step": 140
},
{
"epoch": 0.1580246913580247,
"grad_norm": 0.6742960810661316,
"learning_rate": 1.5789473684210526e-05,
"loss": 1.1008,
"step": 160
},
{
"epoch": 0.17777777777777778,
"grad_norm": 0.6822540760040283,
"learning_rate": 1.7763157894736842e-05,
"loss": 1.0732,
"step": 180
},
{
"epoch": 0.19753086419753085,
"grad_norm": 0.7084145545959473,
"learning_rate": 1.9736842105263158e-05,
"loss": 1.0525,
"step": 200
},
{
"epoch": 0.19753086419753085,
"eval_loss": 1.0499310493469238,
"eval_runtime": 402.5074,
"eval_samples_per_second": 4.472,
"eval_steps_per_second": 1.118,
"step": 200
},
{
"epoch": 0.21728395061728395,
"grad_norm": 0.8174996972084045,
"learning_rate": 2.1710526315789474e-05,
"loss": 1.0711,
"step": 220
},
{
"epoch": 0.23703703703703705,
"grad_norm": 0.8514217138290405,
"learning_rate": 2.368421052631579e-05,
"loss": 1.0147,
"step": 240
},
{
"epoch": 0.25679012345679014,
"grad_norm": 0.8636080622673035,
"learning_rate": 2.5657894736842107e-05,
"loss": 1.032,
"step": 260
},
{
"epoch": 0.2765432098765432,
"grad_norm": 0.8430706262588501,
"learning_rate": 2.7631578947368423e-05,
"loss": 1.0326,
"step": 280
},
{
"epoch": 0.2962962962962963,
"grad_norm": 0.9532914757728577,
"learning_rate": 2.9605263157894735e-05,
"loss": 1.0488,
"step": 300
},
{
"epoch": 0.2962962962962963,
"eval_loss": 1.0270123481750488,
"eval_runtime": 402.3395,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.118,
"step": 300
},
{
"epoch": 0.3160493827160494,
"grad_norm": 0.9832524061203003,
"learning_rate": 2.9997461206762896e-05,
"loss": 1.0209,
"step": 320
},
{
"epoch": 0.3358024691358025,
"grad_norm": 0.9382938146591187,
"learning_rate": 2.998714883211034e-05,
"loss": 1.0287,
"step": 340
},
{
"epoch": 0.35555555555555557,
"grad_norm": 1.03255295753479,
"learning_rate": 2.9968909651554313e-05,
"loss": 1.0195,
"step": 360
},
{
"epoch": 0.37530864197530867,
"grad_norm": 1.0193625688552856,
"learning_rate": 2.994275331192262e-05,
"loss": 1.0104,
"step": 380
},
{
"epoch": 0.3950617283950617,
"grad_norm": 0.9543349146842957,
"learning_rate": 2.9908693647482852e-05,
"loss": 1.0032,
"step": 400
},
{
"epoch": 0.3950617283950617,
"eval_loss": 1.0094538927078247,
"eval_runtime": 402.3092,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.119,
"step": 400
},
{
"epoch": 0.4148148148148148,
"grad_norm": 1.0028969049453735,
"learning_rate": 2.9866748672625354e-05,
"loss": 1.0,
"step": 420
},
{
"epoch": 0.4345679012345679,
"grad_norm": 1.1169507503509521,
"learning_rate": 2.9816940572335275e-05,
"loss": 1.0028,
"step": 440
},
{
"epoch": 0.454320987654321,
"grad_norm": 1.0066871643066406,
"learning_rate": 2.9759295690458793e-05,
"loss": 0.9991,
"step": 460
},
{
"epoch": 0.4740740740740741,
"grad_norm": 1.1250879764556885,
"learning_rate": 2.9693844515769658e-05,
"loss": 1.0275,
"step": 480
},
{
"epoch": 0.49382716049382713,
"grad_norm": 0.9638034701347351,
"learning_rate": 2.9620621665843482e-05,
"loss": 1.0097,
"step": 500
},
{
"epoch": 0.49382716049382713,
"eval_loss": 0.9942829012870789,
"eval_runtime": 402.3967,
"eval_samples_per_second": 4.473,
"eval_steps_per_second": 1.118,
"step": 500
},
{
"epoch": 0.5135802469135803,
"grad_norm": 1.106367826461792,
"learning_rate": 2.953966586874827e-05,
"loss": 1.0219,
"step": 520
},
{
"epoch": 0.5333333333333333,
"grad_norm": 1.0724130868911743,
"learning_rate": 2.9451019942560854e-05,
"loss": 0.9827,
"step": 540
},
{
"epoch": 0.5530864197530864,
"grad_norm": 1.0933202505111694,
"learning_rate": 2.9354730772720152e-05,
"loss": 1.0033,
"step": 560
},
{
"epoch": 0.5728395061728395,
"grad_norm": 1.089522123336792,
"learning_rate": 2.9250849287229115e-05,
"loss": 0.9558,
"step": 580
},
{
"epoch": 0.5925925925925926,
"grad_norm": 1.0908564329147339,
"learning_rate": 2.9139430429718557e-05,
"loss": 0.9702,
"step": 600
},
{
"epoch": 0.5925925925925926,
"eval_loss": 0.9849551916122437,
"eval_runtime": 402.4211,
"eval_samples_per_second": 4.473,
"eval_steps_per_second": 1.118,
"step": 600
},
{
"epoch": 0.6123456790123457,
"grad_norm": 1.0643543004989624,
"learning_rate": 2.90205331303871e-05,
"loss": 0.9678,
"step": 620
},
{
"epoch": 0.6320987654320988,
"grad_norm": 1.1446090936660767,
"learning_rate": 2.889422027483259e-05,
"loss": 0.9617,
"step": 640
},
{
"epoch": 0.6518518518518519,
"grad_norm": 1.2303221225738525,
"learning_rate": 2.876055867079146e-05,
"loss": 0.9939,
"step": 660
},
{
"epoch": 0.671604938271605,
"grad_norm": 1.1191219091415405,
"learning_rate": 2.8619619012803674e-05,
"loss": 0.986,
"step": 680
},
{
"epoch": 0.691358024691358,
"grad_norm": 1.2467299699783325,
"learning_rate": 2.847147584482188e-05,
"loss": 0.9787,
"step": 700
},
{
"epoch": 0.691358024691358,
"eval_loss": 0.9761277437210083,
"eval_runtime": 402.3652,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.118,
"step": 700
},
{
"epoch": 0.7111111111111111,
"grad_norm": 1.1553202867507935,
"learning_rate": 2.8316207520784622e-05,
"loss": 0.9545,
"step": 720
},
{
"epoch": 0.7308641975308642,
"grad_norm": 1.162398338317871,
"learning_rate": 2.81538961631744e-05,
"loss": 0.9876,
"step": 740
},
{
"epoch": 0.7506172839506173,
"grad_norm": 1.1037890911102295,
"learning_rate": 2.7984627619582507e-05,
"loss": 0.9526,
"step": 760
},
{
"epoch": 0.7703703703703704,
"grad_norm": 1.1114506721496582,
"learning_rate": 2.7808491417303672e-05,
"loss": 1.0013,
"step": 780
},
{
"epoch": 0.7901234567901234,
"grad_norm": 1.140010118484497,
"learning_rate": 2.7625580715984452e-05,
"loss": 0.9754,
"step": 800
},
{
"epoch": 0.7901234567901234,
"eval_loss": 0.9668111205101013,
"eval_runtime": 402.4946,
"eval_samples_per_second": 4.472,
"eval_steps_per_second": 1.118,
"step": 800
},
{
"epoch": 0.8098765432098766,
"grad_norm": 1.1689811944961548,
"learning_rate": 2.7435992258350444e-05,
"loss": 0.979,
"step": 820
},
{
"epoch": 0.8296296296296296,
"grad_norm": 1.045784592628479,
"learning_rate": 2.7239826319038413e-05,
"loss": 0.9723,
"step": 840
},
{
"epoch": 0.8493827160493828,
"grad_norm": 1.1769437789916992,
"learning_rate": 2.703718665156033e-05,
"loss": 0.9709,
"step": 860
},
{
"epoch": 0.8691358024691358,
"grad_norm": 1.0712182521820068,
"learning_rate": 2.6828180433427437e-05,
"loss": 0.964,
"step": 880
},
{
"epoch": 0.8888888888888888,
"grad_norm": 1.4096373319625854,
"learning_rate": 2.6612918209463323e-05,
"loss": 0.9775,
"step": 900
},
{
"epoch": 0.8888888888888888,
"eval_loss": 0.963696300983429,
"eval_runtime": 402.3913,
"eval_samples_per_second": 4.473,
"eval_steps_per_second": 1.118,
"step": 900
},
{
"epoch": 0.908641975308642,
"grad_norm": 1.0928242206573486,
"learning_rate": 2.6391513833336013e-05,
"loss": 0.9557,
"step": 920
},
{
"epoch": 0.928395061728395,
"grad_norm": 1.1433868408203125,
"learning_rate": 2.616408440733997e-05,
"loss": 0.9321,
"step": 940
},
{
"epoch": 0.9481481481481482,
"grad_norm": 1.1303808689117432,
"learning_rate": 2.5930750220459893e-05,
"loss": 0.9873,
"step": 960
},
{
"epoch": 0.9679012345679012,
"grad_norm": 1.2201975584030151,
"learning_rate": 2.569163468474906e-05,
"loss": 0.9635,
"step": 980
},
{
"epoch": 0.9876543209876543,
"grad_norm": 1.1534947156906128,
"learning_rate": 2.5446864270055825e-05,
"loss": 0.9749,
"step": 1000
},
{
"epoch": 0.9876543209876543,
"eval_loss": 0.9554852843284607,
"eval_runtime": 402.4957,
"eval_samples_per_second": 4.472,
"eval_steps_per_second": 1.118,
"step": 1000
},
{
"epoch": 1.0069135802469136,
"grad_norm": 1.2161285877227783,
"learning_rate": 2.5196568437132855e-05,
"loss": 0.946,
"step": 1020
},
{
"epoch": 1.0266666666666666,
"grad_norm": 1.110687255859375,
"learning_rate": 2.4940879569164453e-05,
"loss": 0.9553,
"step": 1040
},
{
"epoch": 1.0464197530864197,
"grad_norm": 1.1861077547073364,
"learning_rate": 2.467993290174819e-05,
"loss": 0.9416,
"step": 1060
},
{
"epoch": 1.066172839506173,
"grad_norm": 1.2155508995056152,
"learning_rate": 2.4413866451367836e-05,
"loss": 0.9075,
"step": 1080
},
{
"epoch": 1.085925925925926,
"grad_norm": 1.3916659355163574,
"learning_rate": 2.414282094239555e-05,
"loss": 0.9344,
"step": 1100
},
{
"epoch": 1.085925925925926,
"eval_loss": 0.9527194499969482,
"eval_runtime": 402.3177,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.119,
"step": 1100
},
{
"epoch": 1.105679012345679,
"grad_norm": 1.2178341150283813,
"learning_rate": 2.386693973266173e-05,
"loss": 0.9271,
"step": 1120
},
{
"epoch": 1.125432098765432,
"grad_norm": 1.295937418937683,
"learning_rate": 2.3586368737632124e-05,
"loss": 0.9078,
"step": 1140
},
{
"epoch": 1.145185185185185,
"grad_norm": 1.3823224306106567,
"learning_rate": 2.3301256353232112e-05,
"loss": 0.9113,
"step": 1160
},
{
"epoch": 1.1649382716049383,
"grad_norm": 1.3728779554367065,
"learning_rate": 2.3011753377359084e-05,
"loss": 0.9135,
"step": 1180
},
{
"epoch": 1.1846913580246914,
"grad_norm": 1.2611992359161377,
"learning_rate": 2.2718012930124407e-05,
"loss": 0.9178,
"step": 1200
},
{
"epoch": 1.1846913580246914,
"eval_loss": 0.9479934573173523,
"eval_runtime": 402.3084,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.119,
"step": 1200
},
{
"epoch": 1.2044444444444444,
"grad_norm": 1.2411032915115356,
"learning_rate": 2.2420190372867144e-05,
"loss": 0.9159,
"step": 1220
},
{
"epoch": 1.2241975308641975,
"grad_norm": 1.3021560907363892,
"learning_rate": 2.2118443225982365e-05,
"loss": 0.8981,
"step": 1240
},
{
"epoch": 1.2439506172839505,
"grad_norm": 1.3610398769378662,
"learning_rate": 2.1812931085607537e-05,
"loss": 0.9121,
"step": 1260
},
{
"epoch": 1.2637037037037038,
"grad_norm": 1.310373067855835,
"learning_rate": 2.1503815539211034e-05,
"loss": 0.8987,
"step": 1280
},
{
"epoch": 1.2834567901234568,
"grad_norm": 1.2247895002365112,
"learning_rate": 2.119126008012741e-05,
"loss": 0.9115,
"step": 1300
},
{
"epoch": 1.2834567901234568,
"eval_loss": 0.9459941983222961,
"eval_runtime": 402.3726,
"eval_samples_per_second": 4.473,
"eval_steps_per_second": 1.118,
"step": 1300
},
{
"epoch": 1.3032098765432099,
"grad_norm": 1.2773354053497314,
"learning_rate": 2.0875430021084665e-05,
"loss": 0.924,
"step": 1320
},
{
"epoch": 1.322962962962963,
"grad_norm": 1.2930251359939575,
"learning_rate": 2.0556492406769176e-05,
"loss": 0.9201,
"step": 1340
},
{
"epoch": 1.342716049382716,
"grad_norm": 1.255893349647522,
"learning_rate": 2.0234615925474648e-05,
"loss": 0.9378,
"step": 1360
},
{
"epoch": 1.3624691358024692,
"grad_norm": 1.2988559007644653,
"learning_rate": 1.9909970819881708e-05,
"loss": 0.9004,
"step": 1380
},
{
"epoch": 1.3822222222222222,
"grad_norm": 1.328128457069397,
"learning_rate": 1.9582728797015385e-05,
"loss": 0.921,
"step": 1400
},
{
"epoch": 1.3822222222222222,
"eval_loss": 0.9410489797592163,
"eval_runtime": 402.2547,
"eval_samples_per_second": 4.475,
"eval_steps_per_second": 1.119,
"step": 1400
},
{
"epoch": 1.4019753086419753,
"grad_norm": 1.3988349437713623,
"learning_rate": 1.9253062937428073e-05,
"loss": 0.9056,
"step": 1420
},
{
"epoch": 1.4217283950617283,
"grad_norm": 1.256790041923523,
"learning_rate": 1.892114760365605e-05,
"loss": 0.9073,
"step": 1440
},
{
"epoch": 1.4414814814814814,
"grad_norm": 1.3246599435806274,
"learning_rate": 1.8587158347997932e-05,
"loss": 0.9097,
"step": 1460
},
{
"epoch": 1.4612345679012346,
"grad_norm": 1.2596899271011353,
"learning_rate": 1.8251271819663863e-05,
"loss": 0.9104,
"step": 1480
},
{
"epoch": 1.4809876543209877,
"grad_norm": 1.2959362268447876,
"learning_rate": 1.7913665671344526e-05,
"loss": 0.8994,
"step": 1500
},
{
"epoch": 1.4809876543209877,
"eval_loss": 0.9367458820343018,
"eval_runtime": 402.3021,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.119,
"step": 1500
},
{
"epoch": 1.5007407407407407,
"grad_norm": 1.2440412044525146,
"learning_rate": 1.7574518465249413e-05,
"loss": 0.9056,
"step": 1520
},
{
"epoch": 1.520493827160494,
"grad_norm": 1.441502571105957,
"learning_rate": 1.7234009578664066e-05,
"loss": 0.9264,
"step": 1540
},
{
"epoch": 1.5402469135802468,
"grad_norm": 1.3158551454544067,
"learning_rate": 1.6892319109076183e-05,
"loss": 0.8845,
"step": 1560
},
{
"epoch": 1.56,
"grad_norm": 1.5368109941482544,
"learning_rate": 1.654962777892081e-05,
"loss": 0.9141,
"step": 1580
},
{
"epoch": 1.579753086419753,
"grad_norm": 1.3186088800430298,
"learning_rate": 1.6206116839995033e-05,
"loss": 0.8878,
"step": 1600
},
{
"epoch": 1.579753086419753,
"eval_loss": 0.9328420758247375,
"eval_runtime": 402.4724,
"eval_samples_per_second": 4.472,
"eval_steps_per_second": 1.118,
"step": 1600
},
{
"epoch": 1.5995061728395061,
"grad_norm": 1.448764443397522,
"learning_rate": 1.5861967977592642e-05,
"loss": 0.8936,
"step": 1620
},
{
"epoch": 1.6192592592592594,
"grad_norm": 1.3021979331970215,
"learning_rate": 1.5517363214409528e-05,
"loss": 0.9185,
"step": 1640
},
{
"epoch": 1.6390123456790122,
"grad_norm": 1.3101555109024048,
"learning_rate": 1.5172484814270635e-05,
"loss": 0.9109,
"step": 1660
},
{
"epoch": 1.6587654320987655,
"grad_norm": 1.3461183309555054,
"learning_rate": 1.4827515185729368e-05,
"loss": 0.9045,
"step": 1680
},
{
"epoch": 1.6785185185185185,
"grad_norm": 1.3536429405212402,
"learning_rate": 1.4482636785590474e-05,
"loss": 0.8981,
"step": 1700
},
{
"epoch": 1.6785185185185185,
"eval_loss": 0.9300320148468018,
"eval_runtime": 402.5102,
"eval_samples_per_second": 4.472,
"eval_steps_per_second": 1.118,
"step": 1700
},
{
"epoch": 1.6982716049382716,
"grad_norm": 1.2944140434265137,
"learning_rate": 1.413803202240736e-05,
"loss": 0.9127,
"step": 1720
},
{
"epoch": 1.7180246913580248,
"grad_norm": 1.3316771984100342,
"learning_rate": 1.3793883160004971e-05,
"loss": 0.9157,
"step": 1740
},
{
"epoch": 1.7377777777777776,
"grad_norm": 1.403693675994873,
"learning_rate": 1.3450372221079193e-05,
"loss": 0.8998,
"step": 1760
},
{
"epoch": 1.757530864197531,
"grad_norm": 1.3952233791351318,
"learning_rate": 1.3107680890923821e-05,
"loss": 0.9139,
"step": 1780
},
{
"epoch": 1.777283950617284,
"grad_norm": 1.3515853881835938,
"learning_rate": 1.2765990421335937e-05,
"loss": 0.9178,
"step": 1800
},
{
"epoch": 1.777283950617284,
"eval_loss": 0.9266696572303772,
"eval_runtime": 402.3456,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.118,
"step": 1800
},
{
"epoch": 1.797037037037037,
"grad_norm": 1.3852437734603882,
"learning_rate": 1.2425481534750591e-05,
"loss": 0.9189,
"step": 1820
},
{
"epoch": 1.8167901234567903,
"grad_norm": 1.372295618057251,
"learning_rate": 1.2086334328655478e-05,
"loss": 0.8969,
"step": 1840
},
{
"epoch": 1.836543209876543,
"grad_norm": 1.6304378509521484,
"learning_rate": 1.1748728180336137e-05,
"loss": 0.903,
"step": 1860
},
{
"epoch": 1.8562962962962963,
"grad_norm": 1.3534801006317139,
"learning_rate": 1.141284165200207e-05,
"loss": 0.9219,
"step": 1880
},
{
"epoch": 1.8760493827160494,
"grad_norm": 1.4054875373840332,
"learning_rate": 1.1078852396343955e-05,
"loss": 0.9009,
"step": 1900
},
{
"epoch": 1.8760493827160494,
"eval_loss": 0.923714280128479,
"eval_runtime": 402.3854,
"eval_samples_per_second": 4.473,
"eval_steps_per_second": 1.118,
"step": 1900
},
{
"epoch": 1.8958024691358024,
"grad_norm": 1.385722279548645,
"learning_rate": 1.0746937062571928e-05,
"loss": 0.9103,
"step": 1920
},
{
"epoch": 1.9155555555555557,
"grad_norm": 1.3441500663757324,
"learning_rate": 1.0417271202984614e-05,
"loss": 0.9465,
"step": 1940
},
{
"epoch": 1.9353086419753085,
"grad_norm": 1.5040432214736938,
"learning_rate": 1.0090029180118293e-05,
"loss": 0.881,
"step": 1960
},
{
"epoch": 1.9550617283950618,
"grad_norm": 1.401288390159607,
"learning_rate": 9.765384074525358e-06,
"loss": 0.901,
"step": 1980
},
{
"epoch": 1.9748148148148148,
"grad_norm": 1.439374327659607,
"learning_rate": 9.443507593230829e-06,
"loss": 0.904,
"step": 2000
},
{
"epoch": 1.9748148148148148,
"eval_loss": 0.9219183921813965,
"eval_runtime": 402.3558,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.118,
"step": 2000
},
{
"epoch": 1.9945679012345678,
"grad_norm": 1.63518488407135,
"learning_rate": 9.124569978915336e-06,
"loss": 0.9222,
"step": 2020
},
{
"epoch": 2.013827160493827,
"grad_norm": 1.3853759765625,
"learning_rate": 8.808739919872588e-06,
"loss": 0.8659,
"step": 2040
},
{
"epoch": 2.0335802469135804,
"grad_norm": 1.3967058658599854,
"learning_rate": 8.496184460788969e-06,
"loss": 0.8865,
"step": 2060
},
{
"epoch": 2.0533333333333332,
"grad_norm": 1.3898597955703735,
"learning_rate": 8.187068914392464e-06,
"loss": 0.8473,
"step": 2080
},
{
"epoch": 2.0730864197530865,
"grad_norm": 1.4539365768432617,
"learning_rate": 7.881556774017635e-06,
"loss": 0.8638,
"step": 2100
},
{
"epoch": 2.0730864197530865,
"eval_loss": 0.9233973622322083,
"eval_runtime": 402.3351,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.118,
"step": 2100
},
{
"epoch": 2.0928395061728393,
"grad_norm": 1.4145288467407227,
"learning_rate": 7.579809627132857e-06,
"loss": 0.8393,
"step": 2120
},
{
"epoch": 2.1125925925925926,
"grad_norm": 1.436933994293213,
"learning_rate": 7.281987069875591e-06,
"loss": 0.8841,
"step": 2140
},
{
"epoch": 2.132345679012346,
"grad_norm": 1.4067989587783813,
"learning_rate": 6.988246622640921e-06,
"loss": 0.8516,
"step": 2160
},
{
"epoch": 2.1520987654320987,
"grad_norm": 1.5077627897262573,
"learning_rate": 6.698743646767891e-06,
"loss": 0.8749,
"step": 2180
},
{
"epoch": 2.171851851851852,
"grad_norm": 1.599204182624817,
"learning_rate": 6.413631262367882e-06,
"loss": 0.8678,
"step": 2200
},
{
"epoch": 2.171851851851852,
"eval_loss": 0.9224557876586914,
"eval_runtime": 402.3427,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.118,
"step": 2200
},
{
"epoch": 2.1916049382716047,
"grad_norm": 1.4863977432250977,
"learning_rate": 6.1330602673382725e-06,
"loss": 0.8517,
"step": 2220
},
{
"epoch": 2.211358024691358,
"grad_norm": 1.3517553806304932,
"learning_rate": 5.857179057604451e-06,
"loss": 0.8445,
"step": 2240
},
{
"epoch": 2.2311111111111113,
"grad_norm": 1.5938282012939453,
"learning_rate": 5.586133548632161e-06,
"loss": 0.8475,
"step": 2260
},
{
"epoch": 2.250864197530864,
"grad_norm": 1.5121272802352905,
"learning_rate": 5.320067098251815e-06,
"loss": 0.852,
"step": 2280
},
{
"epoch": 2.2706172839506173,
"grad_norm": 1.5417536497116089,
"learning_rate": 5.0591204308355465e-06,
"loss": 0.8463,
"step": 2300
},
{
"epoch": 2.2706172839506173,
"eval_loss": 0.9209318161010742,
"eval_runtime": 402.2865,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.119,
"step": 2300
},
{
"epoch": 2.29037037037037,
"grad_norm": 1.4710192680358887,
"learning_rate": 4.803431562867145e-06,
"loss": 0.8782,
"step": 2320
},
{
"epoch": 2.3101234567901234,
"grad_norm": 1.4649263620376587,
"learning_rate": 4.5531357299441774e-06,
"loss": 0.8881,
"step": 2340
},
{
"epoch": 2.3298765432098767,
"grad_norm": 1.5059787034988403,
"learning_rate": 4.3083653152509434e-06,
"loss": 0.859,
"step": 2360
},
{
"epoch": 2.3496296296296295,
"grad_norm": 1.481704831123352,
"learning_rate": 4.069249779540108e-06,
"loss": 0.8733,
"step": 2380
},
{
"epoch": 2.3693827160493828,
"grad_norm": 1.5068329572677612,
"learning_rate": 3.835915592660032e-06,
"loss": 0.832,
"step": 2400
},
{
"epoch": 2.3693827160493828,
"eval_loss": 0.9204065203666687,
"eval_runtime": 402.3595,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.118,
"step": 2400
},
{
"epoch": 2.389135802469136,
"grad_norm": 1.5572285652160645,
"learning_rate": 3.6084861666639856e-06,
"loss": 0.8649,
"step": 2420
},
{
"epoch": 2.408888888888889,
"grad_norm": 1.519260287284851,
"learning_rate": 3.387081790536677e-06,
"loss": 0.8452,
"step": 2440
},
{
"epoch": 2.428641975308642,
"grad_norm": 1.5407612323760986,
"learning_rate": 3.171819566572563e-06,
"loss": 0.8637,
"step": 2460
},
{
"epoch": 2.448395061728395,
"grad_norm": 1.5315485000610352,
"learning_rate": 2.962813348439669e-06,
"loss": 0.8348,
"step": 2480
},
{
"epoch": 2.468148148148148,
"grad_norm": 1.5446561574935913,
"learning_rate": 2.7601736809615883e-06,
"loss": 0.8572,
"step": 2500
},
{
"epoch": 2.468148148148148,
"eval_loss": 0.9187188148498535,
"eval_runtime": 402.5088,
"eval_samples_per_second": 4.472,
"eval_steps_per_second": 1.118,
"step": 2500
},
{
"epoch": 2.487901234567901,
"grad_norm": 1.7411221265792847,
"learning_rate": 2.564007741649559e-06,
"loss": 0.8592,
"step": 2520
},
{
"epoch": 2.5076543209876543,
"grad_norm": 1.5264136791229248,
"learning_rate": 2.374419284015552e-06,
"loss": 0.841,
"step": 2540
},
{
"epoch": 2.5274074074074075,
"grad_norm": 1.6637004613876343,
"learning_rate": 2.191508582696329e-06,
"loss": 0.8427,
"step": 2560
},
{
"epoch": 2.5471604938271604,
"grad_norm": 1.4840551614761353,
"learning_rate": 2.0153723804174945e-06,
"loss": 0.8604,
"step": 2580
},
{
"epoch": 2.5669135802469136,
"grad_norm": 1.530154824256897,
"learning_rate": 1.8461038368256027e-06,
"loss": 0.8788,
"step": 2600
},
{
"epoch": 2.5669135802469136,
"eval_loss": 0.9180880188941956,
"eval_runtime": 402.2861,
"eval_samples_per_second": 4.474,
"eval_steps_per_second": 1.119,
"step": 2600
}
],
"logging_steps": 20,
"max_steps": 3036,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.8563300999472087e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}