5456es's picture
Upload trainer_state.json with huggingface_hub
13f9ef4 verified
Raw History Blame Contribute Delete
487 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.99860529986053,
"eval_steps": 500,
"global_step": 9320,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0042913850445231196,
"grad_norm": 123.28223820003826,
"learning_rate": 9.990343347639485e-07,
"logits/chosen": -0.46645814180374146,
"logits/rejected": -0.4908203184604645,
"logps/chosen": -369.8999938964844,
"logps/rejected": -336.25,
"loss": 0.6198,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": -0.25081557035446167,
"rewards/margins": 0.2138805389404297,
"rewards/rejected": -0.46480637788772583,
"step": 10
},
{
"epoch": 0.008582770089046239,
"grad_norm": 122.85628104182864,
"learning_rate": 9.979613733905578e-07,
"logits/chosen": -0.5171264410018921,
"logits/rejected": -0.49293214082717896,
"logps/chosen": -381.7875061035156,
"logps/rejected": -355.3999938964844,
"loss": 0.616,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.48773193359375,
"rewards/margins": 0.5217529535293579,
"rewards/rejected": -1.0099608898162842,
"step": 20
},
{
"epoch": 0.012874155133569359,
"grad_norm": 117.51108293633276,
"learning_rate": 9.968884120171673e-07,
"logits/chosen": -0.436453253030777,
"logits/rejected": -0.4932495057582855,
"logps/chosen": -357.95001220703125,
"logps/rejected": -361.2875061035156,
"loss": 0.6055,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.6916564702987671,
"rewards/margins": 0.747241199016571,
"rewards/rejected": -1.4387695789337158,
"step": 30
},
{
"epoch": 0.017165540178092478,
"grad_norm": 151.22091963503527,
"learning_rate": 9.958154506437768e-07,
"logits/chosen": -0.533123791217804,
"logits/rejected": -0.559246838092804,
"logps/chosen": -376.48748779296875,
"logps/rejected": -337.1000061035156,
"loss": 0.6231,
"rewards/accuracies": 0.625,
"rewards/chosen": -1.1417968273162842,
"rewards/margins": 0.6675170660018921,
"rewards/rejected": -1.8093750476837158,
"step": 40
},
{
"epoch": 0.021456925222615598,
"grad_norm": 123.7656817343817,
"learning_rate": 9.94742489270386e-07,
"logits/chosen": -0.521679699420929,
"logits/rejected": -0.548785388469696,
"logps/chosen": -374.9750061035156,
"logps/rejected": -351.125,
"loss": 0.6409,
"rewards/accuracies": 0.6187499761581421,
"rewards/chosen": -1.1759154796600342,
"rewards/margins": 0.64508056640625,
"rewards/rejected": -1.821191430091858,
"step": 50
},
{
"epoch": 0.025748310267138717,
"grad_norm": 120.53172544442593,
"learning_rate": 9.936695278969956e-07,
"logits/chosen": -0.49163818359375,
"logits/rejected": -0.4847168028354645,
"logps/chosen": -352.17498779296875,
"logps/rejected": -360.375,
"loss": 0.6393,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.9949951171875,
"rewards/margins": 0.642443835735321,
"rewards/rejected": -1.6369140148162842,
"step": 60
},
{
"epoch": 0.03003969531166184,
"grad_norm": 102.03379010098669,
"learning_rate": 9.925965665236051e-07,
"logits/chosen": -0.484405517578125,
"logits/rejected": -0.4980102479457855,
"logps/chosen": -356.9624938964844,
"logps/rejected": -352.1625061035156,
"loss": 0.5665,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.14703521132469177,
"rewards/margins": 0.7410827875137329,
"rewards/rejected": -0.8876098394393921,
"step": 70
},
{
"epoch": 0.034331080356184956,
"grad_norm": 122.14870656709334,
"learning_rate": 9.915236051502144e-07,
"logits/chosen": -0.43037110567092896,
"logits/rejected": -0.4543823301792145,
"logps/chosen": -370.70001220703125,
"logps/rejected": -349.7250061035156,
"loss": 0.595,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.05336303636431694,
"rewards/margins": 0.5692199468612671,
"rewards/rejected": -0.5160888433456421,
"step": 80
},
{
"epoch": 0.03862246540070808,
"grad_norm": 128.38432934049678,
"learning_rate": 9.90450643776824e-07,
"logits/chosen": -0.520336925983429,
"logits/rejected": -0.580810546875,
"logps/chosen": -338.75,
"logps/rejected": -324.6625061035156,
"loss": 0.5676,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.16399535536766052,
"rewards/margins": 0.7056518793106079,
"rewards/rejected": -0.541949450969696,
"step": 90
},
{
"epoch": 0.042913850445231196,
"grad_norm": 94.4501542954361,
"learning_rate": 9.893776824034335e-07,
"logits/chosen": -0.45356446504592896,
"logits/rejected": -0.4798583984375,
"logps/chosen": -360.07501220703125,
"logps/rejected": -344.2749938964844,
"loss": 0.6084,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": 0.07201538234949112,
"rewards/margins": 0.6812499761581421,
"rewards/rejected": -0.6087402105331421,
"step": 100
},
{
"epoch": 0.04720523548975432,
"grad_norm": 111.56625191783166,
"learning_rate": 9.88304721030043e-07,
"logits/chosen": -0.4960693418979645,
"logits/rejected": -0.518139660358429,
"logps/chosen": -335.7124938964844,
"logps/rejected": -313.32501220703125,
"loss": 0.5617,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.01784667931497097,
"rewards/margins": 0.7183471918106079,
"rewards/rejected": -0.736370861530304,
"step": 110
},
{
"epoch": 0.051496620534277435,
"grad_norm": 86.40836010580634,
"learning_rate": 9.872317596566523e-07,
"logits/chosen": -0.475289911031723,
"logits/rejected": -0.514575183391571,
"logps/chosen": -361.32501220703125,
"logps/rejected": -335.04998779296875,
"loss": 0.6201,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.201191708445549,
"rewards/margins": 0.6319335699081421,
"rewards/rejected": -0.83392333984375,
"step": 120
},
{
"epoch": 0.05578800557880056,
"grad_norm": 108.4407162182439,
"learning_rate": 9.861587982832618e-07,
"logits/chosen": -0.4857849180698395,
"logits/rejected": -0.5697387456893921,
"logps/chosen": -365.92498779296875,
"logps/rejected": -368.0,
"loss": 0.5427,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.5403381586074829,
"rewards/margins": 0.994189441204071,
"rewards/rejected": -1.5349609851837158,
"step": 130
},
{
"epoch": 0.06007939062332368,
"grad_norm": 91.93070866908043,
"learning_rate": 9.850858369098713e-07,
"logits/chosen": -0.571911633014679,
"logits/rejected": -0.5480591058731079,
"logps/chosen": -348.875,
"logps/rejected": -330.5375061035156,
"loss": 0.5136,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": -0.6399291753768921,
"rewards/margins": 1.2383301258087158,
"rewards/rejected": -1.878662109375,
"step": 140
},
{
"epoch": 0.0643707756678468,
"grad_norm": 107.23765646095339,
"learning_rate": 9.840128755364806e-07,
"logits/chosen": -0.5753418207168579,
"logits/rejected": -0.6225036382675171,
"logps/chosen": -336.75,
"logps/rejected": -314.1499938964844,
"loss": 0.5343,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": 0.21926268935203552,
"rewards/margins": 1.053491234779358,
"rewards/rejected": -0.834228515625,
"step": 150
},
{
"epoch": 0.06866216071236991,
"grad_norm": 97.39366534760427,
"learning_rate": 9.829399141630902e-07,
"logits/chosen": -0.4952026307582855,
"logits/rejected": -0.5407348871231079,
"logps/chosen": -360.0249938964844,
"logps/rejected": -369.8999938964844,
"loss": 0.5667,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.79168701171875,
"rewards/margins": 0.9612060785293579,
"rewards/rejected": -0.16872557997703552,
"step": 160
},
{
"epoch": 0.07295354575689304,
"grad_norm": 84.94364687919794,
"learning_rate": 9.818669527896995e-07,
"logits/chosen": -0.5259033441543579,
"logits/rejected": -0.5442749261856079,
"logps/chosen": -321.7250061035156,
"logps/rejected": -324.51251220703125,
"loss": 0.5968,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": 1.13275146484375,
"rewards/margins": 0.671069324016571,
"rewards/rejected": 0.4611450135707855,
"step": 170
},
{
"epoch": 0.07724493080141616,
"grad_norm": 76.4469906176523,
"learning_rate": 9.80793991416309e-07,
"logits/chosen": -0.5499267578125,
"logits/rejected": -0.5405212640762329,
"logps/chosen": -360.4750061035156,
"logps/rejected": -347.7250061035156,
"loss": 0.5593,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 1.1092345714569092,
"rewards/margins": 0.812255859375,
"rewards/rejected": 0.2970214784145355,
"step": 180
},
{
"epoch": 0.08153631584593928,
"grad_norm": 84.08622109044897,
"learning_rate": 9.797210300429185e-07,
"logits/chosen": -0.605517566204071,
"logits/rejected": -0.650634765625,
"logps/chosen": -374.0625,
"logps/rejected": -345.7250061035156,
"loss": 0.5754,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.30867308378219604,
"rewards/margins": 1.064306616783142,
"rewards/rejected": -0.755444347858429,
"step": 190
},
{
"epoch": 0.08582770089046239,
"grad_norm": 100.50953765509824,
"learning_rate": 9.786480686695278e-07,
"logits/chosen": -0.599346935749054,
"logits/rejected": -0.62518310546875,
"logps/chosen": -348.75,
"logps/rejected": -324.20001220703125,
"loss": 0.6844,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": 0.18247680366039276,
"rewards/margins": 0.8165283203125,
"rewards/rejected": -0.632855236530304,
"step": 200
},
{
"epoch": 0.09011908593498552,
"grad_norm": 82.11434421339153,
"learning_rate": 9.775751072961373e-07,
"logits/chosen": -0.54498291015625,
"logits/rejected": -0.5819457769393921,
"logps/chosen": -369.1000061035156,
"logps/rejected": -355.3500061035156,
"loss": 0.5911,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.3947997987270355,
"rewards/margins": 1.1294434070587158,
"rewards/rejected": -0.734039306640625,
"step": 210
},
{
"epoch": 0.09441047097950864,
"grad_norm": 109.34442126475855,
"learning_rate": 9.765021459227466e-07,
"logits/chosen": -0.4843994081020355,
"logits/rejected": -0.5489135980606079,
"logps/chosen": -317.6499938964844,
"logps/rejected": -294.0249938964844,
"loss": 0.5097,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": 1.204687476158142,
"rewards/margins": 1.0795409679412842,
"rewards/rejected": 0.12577208876609802,
"step": 220
},
{
"epoch": 0.09870185602403175,
"grad_norm": 137.93485882352428,
"learning_rate": 9.754291845493561e-07,
"logits/chosen": -0.5229858160018921,
"logits/rejected": -0.577221691608429,
"logps/chosen": -371.9750061035156,
"logps/rejected": -359.3999938964844,
"loss": 0.53,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": 1.028753638267517,
"rewards/margins": 0.9674072265625,
"rewards/rejected": 0.06160888820886612,
"step": 230
},
{
"epoch": 0.10299324106855487,
"grad_norm": 112.80341271258577,
"learning_rate": 9.743562231759657e-07,
"logits/chosen": -0.572552502155304,
"logits/rejected": -0.583514392375946,
"logps/chosen": -369.57501220703125,
"logps/rejected": -368.125,
"loss": 0.7429,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.36653441190719604,
"rewards/margins": 0.748730480670929,
"rewards/rejected": -0.38227540254592896,
"step": 240
},
{
"epoch": 0.107284626113078,
"grad_norm": 125.70540458557501,
"learning_rate": 9.73283261802575e-07,
"logits/chosen": -0.5268493890762329,
"logits/rejected": -0.5599609613418579,
"logps/chosen": -323.1499938964844,
"logps/rejected": -312.8500061035156,
"loss": 0.6057,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": 0.23374633491039276,
"rewards/margins": 0.94091796875,
"rewards/rejected": -0.706500232219696,
"step": 250
},
{
"epoch": 0.11157601115760112,
"grad_norm": 58.55585095990052,
"learning_rate": 9.722103004291845e-07,
"logits/chosen": -0.544238269329071,
"logits/rejected": -0.611328125,
"logps/chosen": -319.4125061035156,
"logps/rejected": -318.3999938964844,
"loss": 0.4599,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": -0.06166992336511612,
"rewards/margins": 1.2641417980194092,
"rewards/rejected": -1.326074242591858,
"step": 260
},
{
"epoch": 0.11586739620212423,
"grad_norm": 123.2244445602675,
"learning_rate": 9.71137339055794e-07,
"logits/chosen": -0.5576202273368835,
"logits/rejected": -0.5834106206893921,
"logps/chosen": -363.0,
"logps/rejected": -358.5249938964844,
"loss": 0.7247,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.5901733636856079,
"rewards/margins": 0.8073974847793579,
"rewards/rejected": -1.397436499595642,
"step": 270
},
{
"epoch": 0.12015878124664736,
"grad_norm": 155.91245588794678,
"learning_rate": 9.700643776824033e-07,
"logits/chosen": -0.537121593952179,
"logits/rejected": -0.563525378704071,
"logps/chosen": -369.1000061035156,
"logps/rejected": -365.3500061035156,
"loss": 0.5173,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.4778243899345398,
"rewards/margins": 1.3302490711212158,
"rewards/rejected": -1.8080322742462158,
"step": 280
},
{
"epoch": 0.12445016629117048,
"grad_norm": 145.09539210098566,
"learning_rate": 9.689914163090128e-07,
"logits/chosen": -0.550463855266571,
"logits/rejected": -0.563403308391571,
"logps/chosen": -350.1499938964844,
"logps/rejected": -333.32501220703125,
"loss": 0.6547,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.6506713628768921,
"rewards/margins": 1.0596923828125,
"rewards/rejected": -1.710913062095642,
"step": 290
},
{
"epoch": 0.1287415513356936,
"grad_norm": 110.94655724051188,
"learning_rate": 9.679184549356223e-07,
"logits/chosen": -0.5160888433456421,
"logits/rejected": -0.521374523639679,
"logps/chosen": -418.7250061035156,
"logps/rejected": -404.4750061035156,
"loss": 0.5785,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": -0.046630859375,
"rewards/margins": 1.01251220703125,
"rewards/rejected": -1.0598876476287842,
"step": 300
},
{
"epoch": 0.1330329363802167,
"grad_norm": 99.15351728439298,
"learning_rate": 9.668454935622316e-07,
"logits/chosen": -0.41584473848342896,
"logits/rejected": -0.46867674589157104,
"logps/chosen": -352.67498779296875,
"logps/rejected": -338.125,
"loss": 0.5692,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.14049682021141052,
"rewards/margins": 1.0083496570587158,
"rewards/rejected": -1.1495850086212158,
"step": 310
},
{
"epoch": 0.13732432142473983,
"grad_norm": 124.91975033406338,
"learning_rate": 9.657725321888411e-07,
"logits/chosen": -0.4778999388217926,
"logits/rejected": -0.5385467410087585,
"logps/chosen": -382.07501220703125,
"logps/rejected": -372.70001220703125,
"loss": 0.5975,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.22307129204273224,
"rewards/margins": 1.0057373046875,
"rewards/rejected": -1.2289307117462158,
"step": 320
},
{
"epoch": 0.14161570646926294,
"grad_norm": 116.40483723789796,
"learning_rate": 9.646995708154507e-07,
"logits/chosen": -0.500762939453125,
"logits/rejected": -0.529162585735321,
"logps/chosen": -356.23748779296875,
"logps/rejected": -324.17498779296875,
"loss": 0.6105,
"rewards/accuracies": 0.6187499761581421,
"rewards/chosen": 0.037841796875,
"rewards/margins": 0.743518054485321,
"rewards/rejected": -0.7049926519393921,
"step": 330
},
{
"epoch": 0.14590709151378609,
"grad_norm": 116.85502208565543,
"learning_rate": 9.636266094420602e-07,
"logits/chosen": -0.47784423828125,
"logits/rejected": -0.49757081270217896,
"logps/chosen": -362.54998779296875,
"logps/rejected": -328.54998779296875,
"loss": 0.6319,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": -0.04578246921300888,
"rewards/margins": 0.8777099847793579,
"rewards/rejected": -0.92218017578125,
"step": 340
},
{
"epoch": 0.1501984765583092,
"grad_norm": 114.7419504524314,
"learning_rate": 9.625536480686695e-07,
"logits/chosen": -0.6083008050918579,
"logits/rejected": -0.633898913860321,
"logps/chosen": -362.875,
"logps/rejected": -390.3500061035156,
"loss": 0.6299,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": 0.05139770358800888,
"rewards/margins": 0.6855224370956421,
"rewards/rejected": -0.633557140827179,
"step": 350
},
{
"epoch": 0.15448986160283232,
"grad_norm": 100.81303221004438,
"learning_rate": 9.61480686695279e-07,
"logits/chosen": -0.543261706829071,
"logits/rejected": -0.5597778558731079,
"logps/chosen": -350.67498779296875,
"logps/rejected": -342.75,
"loss": 0.5379,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": 0.19191284477710724,
"rewards/margins": 0.8765014410018921,
"rewards/rejected": -0.6850525140762329,
"step": 360
},
{
"epoch": 0.15878124664735543,
"grad_norm": 128.1911073978389,
"learning_rate": 9.604077253218883e-07,
"logits/chosen": -0.5430237054824829,
"logits/rejected": -0.56463623046875,
"logps/chosen": -359.54998779296875,
"logps/rejected": -320.29998779296875,
"loss": 0.6405,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.04185790941119194,
"rewards/margins": 0.782177746295929,
"rewards/rejected": -0.824017345905304,
"step": 370
},
{
"epoch": 0.16307263169187855,
"grad_norm": 101.11922410312341,
"learning_rate": 9.593347639484978e-07,
"logits/chosen": -0.5586913824081421,
"logits/rejected": -0.576916515827179,
"logps/chosen": -369.01251220703125,
"logps/rejected": -352.5,
"loss": 0.5704,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.02469787560403347,
"rewards/margins": 1.112890601158142,
"rewards/rejected": -1.137963891029358,
"step": 380
},
{
"epoch": 0.16736401673640167,
"grad_norm": 81.72591212763665,
"learning_rate": 9.582618025751073e-07,
"logits/chosen": -0.5726379156112671,
"logits/rejected": -0.55267333984375,
"logps/chosen": -403.17498779296875,
"logps/rejected": -369.8999938964844,
"loss": 0.5756,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": -0.17046204209327698,
"rewards/margins": 1.290380835533142,
"rewards/rejected": -1.461035132408142,
"step": 390
},
{
"epoch": 0.17165540178092478,
"grad_norm": 91.69840347728346,
"learning_rate": 9.571888412017166e-07,
"logits/chosen": -0.5492798089981079,
"logits/rejected": -0.545941174030304,
"logps/chosen": -388.0874938964844,
"logps/rejected": -356.1499938964844,
"loss": 0.4508,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": 0.34259033203125,
"rewards/margins": 1.4014160633087158,
"rewards/rejected": -1.0582153797149658,
"step": 400
},
{
"epoch": 0.17594678682544793,
"grad_norm": 100.70519117112231,
"learning_rate": 9.561158798283262e-07,
"logits/chosen": -0.5215393304824829,
"logits/rejected": -0.561474621295929,
"logps/chosen": -326.16876220703125,
"logps/rejected": -326.92498779296875,
"loss": 0.5462,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.27595216035842896,
"rewards/margins": 1.1398437023162842,
"rewards/rejected": -1.415899634361267,
"step": 410
},
{
"epoch": 0.18023817186997104,
"grad_norm": 93.74336628274585,
"learning_rate": 9.550429184549355e-07,
"logits/chosen": -0.5823608636856079,
"logits/rejected": -0.574047863483429,
"logps/chosen": -372.9750061035156,
"logps/rejected": -382.125,
"loss": 0.5921,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": -0.36954957246780396,
"rewards/margins": 1.0365722179412842,
"rewards/rejected": -1.4060790538787842,
"step": 420
},
{
"epoch": 0.18452955691449416,
"grad_norm": 117.78457982524857,
"learning_rate": 9.53969957081545e-07,
"logits/chosen": -0.4588623046875,
"logits/rejected": -0.48617857694625854,
"logps/chosen": -381.625,
"logps/rejected": -363.2749938964844,
"loss": 0.6017,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.17536011338233948,
"rewards/margins": 0.842358410358429,
"rewards/rejected": -1.018072485923767,
"step": 430
},
{
"epoch": 0.18882094195901727,
"grad_norm": 75.84966571616258,
"learning_rate": 9.528969957081545e-07,
"logits/chosen": -0.49233704805374146,
"logits/rejected": -0.515911877155304,
"logps/chosen": -350.76251220703125,
"logps/rejected": -341.3500061035156,
"loss": 0.4495,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": 0.42026060819625854,
"rewards/margins": 1.248266577720642,
"rewards/rejected": -0.8277862668037415,
"step": 440
},
{
"epoch": 0.1931123270035404,
"grad_norm": 119.11996145611178,
"learning_rate": 9.518240343347639e-07,
"logits/chosen": -0.4456543028354645,
"logits/rejected": -0.485992431640625,
"logps/chosen": -380.7749938964844,
"logps/rejected": -357.29998779296875,
"loss": 0.4673,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": 0.802136242389679,
"rewards/margins": 1.6463134288787842,
"rewards/rejected": -0.8443603515625,
"step": 450
},
{
"epoch": 0.1974037120480635,
"grad_norm": 82.4263835338058,
"learning_rate": 9.507510729613733e-07,
"logits/chosen": -0.549328625202179,
"logits/rejected": -0.532366931438446,
"logps/chosen": -388.5874938964844,
"logps/rejected": -337.92498779296875,
"loss": 0.4997,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.844329833984375,
"rewards/margins": 1.3522460460662842,
"rewards/rejected": -0.507617175579071,
"step": 460
},
{
"epoch": 0.20169509709258662,
"grad_norm": 77.79913068760568,
"learning_rate": 9.496781115879828e-07,
"logits/chosen": -0.4855712950229645,
"logits/rejected": -0.511547863483429,
"logps/chosen": -365.3500061035156,
"logps/rejected": -354.7875061035156,
"loss": 0.5443,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.5145324468612671,
"rewards/margins": 1.5306885242462158,
"rewards/rejected": -1.0165526866912842,
"step": 470
},
{
"epoch": 0.20598648213710974,
"grad_norm": 100.68132263754269,
"learning_rate": 9.486051502145921e-07,
"logits/chosen": -0.47947996854782104,
"logits/rejected": -0.5260986089706421,
"logps/chosen": -356.6000061035156,
"logps/rejected": -340.5,
"loss": 0.6298,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.3326416015625,
"rewards/margins": 1.264917016029358,
"rewards/rejected": -0.9325500726699829,
"step": 480
},
{
"epoch": 0.21027786718163288,
"grad_norm": 76.40861266143317,
"learning_rate": 9.475321888412017e-07,
"logits/chosen": -0.49945068359375,
"logits/rejected": -0.562817394733429,
"logps/chosen": -359.95001220703125,
"logps/rejected": -350.67498779296875,
"loss": 0.635,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": 0.824999988079071,
"rewards/margins": 1.1612060070037842,
"rewards/rejected": -0.3360351622104645,
"step": 490
},
{
"epoch": 0.214569252226156,
"grad_norm": 125.71253555859914,
"learning_rate": 9.464592274678112e-07,
"logits/chosen": -0.4984985291957855,
"logits/rejected": -0.54229736328125,
"logps/chosen": -378.375,
"logps/rejected": -372.7250061035156,
"loss": 0.5321,
"rewards/accuracies": 0.71875,
"rewards/chosen": 1.1933104991912842,
"rewards/margins": 1.1146361827850342,
"rewards/rejected": 0.07810058444738388,
"step": 500
},
{
"epoch": 0.21886063727067911,
"grad_norm": 95.40965004395002,
"learning_rate": 9.453862660944205e-07,
"logits/chosen": -0.500109851360321,
"logits/rejected": -0.52734375,
"logps/chosen": -392.82501220703125,
"logps/rejected": -351.3500061035156,
"loss": 0.5787,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": 1.063452124595642,
"rewards/margins": 1.0601806640625,
"rewards/rejected": 0.005053711123764515,
"step": 510
},
{
"epoch": 0.22315202231520223,
"grad_norm": 74.61364708907215,
"learning_rate": 9.4431330472103e-07,
"logits/chosen": -0.48179322481155396,
"logits/rejected": -0.5057128667831421,
"logps/chosen": -380.42498779296875,
"logps/rejected": -344.48748779296875,
"loss": 0.7151,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.3694091737270355,
"rewards/margins": 1.1292603015899658,
"rewards/rejected": -0.7605346441268921,
"step": 520
},
{
"epoch": 0.22744340735972535,
"grad_norm": 53.783363403893034,
"learning_rate": 9.432403433476394e-07,
"logits/chosen": -0.5444580316543579,
"logits/rejected": -0.5545409917831421,
"logps/chosen": -391.92498779296875,
"logps/rejected": -373.42498779296875,
"loss": 0.5574,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.779003918170929,
"rewards/margins": 1.3148682117462158,
"rewards/rejected": -0.535400390625,
"step": 530
},
{
"epoch": 0.23173479240424846,
"grad_norm": 71.56630218026018,
"learning_rate": 9.421673819742488e-07,
"logits/chosen": -0.4359497129917145,
"logits/rejected": -0.47218018770217896,
"logps/chosen": -359.4624938964844,
"logps/rejected": -332.79998779296875,
"loss": 0.5467,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": 0.729156494140625,
"rewards/margins": 1.1874268054962158,
"rewards/rejected": -0.4583740234375,
"step": 540
},
{
"epoch": 0.23602617744877158,
"grad_norm": 83.66000859870482,
"learning_rate": 9.410944206008583e-07,
"logits/chosen": -0.519641101360321,
"logits/rejected": -0.5178298950195312,
"logps/chosen": -367.95001220703125,
"logps/rejected": -364.92498779296875,
"loss": 0.5371,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.520922839641571,
"rewards/margins": 0.9896606206893921,
"rewards/rejected": -0.46781617403030396,
"step": 550
},
{
"epoch": 0.24031756249329472,
"grad_norm": 98.16028149637665,
"learning_rate": 9.400214592274678e-07,
"logits/chosen": -0.5354369878768921,
"logits/rejected": -0.539416491985321,
"logps/chosen": -351.1875,
"logps/rejected": -366.6499938964844,
"loss": 0.6552,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.14227294921875,
"rewards/margins": 0.772296130657196,
"rewards/rejected": -0.6302856206893921,
"step": 560
},
{
"epoch": 0.24460894753781784,
"grad_norm": 120.3807602820233,
"learning_rate": 9.389484978540773e-07,
"logits/chosen": -0.505786120891571,
"logits/rejected": -0.5287231206893921,
"logps/chosen": -407.95001220703125,
"logps/rejected": -365.3500061035156,
"loss": 0.5672,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.16014404594898224,
"rewards/margins": 1.027227759361267,
"rewards/rejected": -0.8665100336074829,
"step": 570
},
{
"epoch": 0.24890033258234096,
"grad_norm": 94.05463646589862,
"learning_rate": 9.378755364806866e-07,
"logits/chosen": -0.4578491151332855,
"logits/rejected": -0.503631591796875,
"logps/chosen": -347.625,
"logps/rejected": -342.67498779296875,
"loss": 0.6144,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.19006958603858948,
"rewards/margins": 1.177221655845642,
"rewards/rejected": -0.986157238483429,
"step": 580
},
{
"epoch": 0.25319171762686404,
"grad_norm": 96.0622685208306,
"learning_rate": 9.368025751072961e-07,
"logits/chosen": -0.45648193359375,
"logits/rejected": -0.4850097596645355,
"logps/chosen": -377.875,
"logps/rejected": -350.625,
"loss": 0.528,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": 0.43720704317092896,
"rewards/margins": 1.2394530773162842,
"rewards/rejected": -0.802227795124054,
"step": 590
},
{
"epoch": 0.2574831026713872,
"grad_norm": 116.19988652027885,
"learning_rate": 9.357296137339056e-07,
"logits/chosen": -0.5290161371231079,
"logits/rejected": -0.538250744342804,
"logps/chosen": -322.32501220703125,
"logps/rejected": -310.375,
"loss": 0.5809,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.8603149652481079,
"rewards/margins": 1.279638648033142,
"rewards/rejected": -0.4193115234375,
"step": 600
},
{
"epoch": 0.26177448771591033,
"grad_norm": 117.07665088552639,
"learning_rate": 9.346566523605149e-07,
"logits/chosen": -0.5156494379043579,
"logits/rejected": -0.4985107481479645,
"logps/chosen": -346.42498779296875,
"logps/rejected": -361.25,
"loss": 0.6903,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.5416504144668579,
"rewards/margins": 0.9817138910293579,
"rewards/rejected": -0.4396118223667145,
"step": 610
},
{
"epoch": 0.2660658727604334,
"grad_norm": 111.00597088432458,
"learning_rate": 9.335836909871244e-07,
"logits/chosen": -0.491018682718277,
"logits/rejected": -0.5232299566268921,
"logps/chosen": -379.125,
"logps/rejected": -347.5249938964844,
"loss": 0.6917,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.4049438536167145,
"rewards/margins": 0.8136962652206421,
"rewards/rejected": -0.40876466035842896,
"step": 620
},
{
"epoch": 0.27035725780495656,
"grad_norm": 96.2197512844947,
"learning_rate": 9.325107296137338e-07,
"logits/chosen": -0.5179535150527954,
"logits/rejected": -0.52593994140625,
"logps/chosen": -353.63751220703125,
"logps/rejected": -387.6499938964844,
"loss": 0.6251,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.011566162109375,
"rewards/margins": 0.927441418170929,
"rewards/rejected": -0.9385620355606079,
"step": 630
},
{
"epoch": 0.27464864284947965,
"grad_norm": 69.60649548304919,
"learning_rate": 9.314377682403433e-07,
"logits/chosen": -0.41236573457717896,
"logits/rejected": -0.4709274172782898,
"logps/chosen": -361.8374938964844,
"logps/rejected": -336.67498779296875,
"loss": 0.58,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.27885740995407104,
"rewards/margins": 1.119421362876892,
"rewards/rejected": -0.8396850824356079,
"step": 640
},
{
"epoch": 0.2789400278940028,
"grad_norm": 87.23889104729567,
"learning_rate": 9.303648068669528e-07,
"logits/chosen": -0.47505491971969604,
"logits/rejected": -0.516845703125,
"logps/chosen": -343.88751220703125,
"logps/rejected": -319.07501220703125,
"loss": 0.5413,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": 0.35932618379592896,
"rewards/margins": 1.234075903892517,
"rewards/rejected": -0.87445068359375,
"step": 650
},
{
"epoch": 0.2832314129385259,
"grad_norm": 136.43154228077452,
"learning_rate": 9.292918454935622e-07,
"logits/chosen": -0.4903015196323395,
"logits/rejected": -0.517138659954071,
"logps/chosen": -381.8500061035156,
"logps/rejected": -368.0625,
"loss": 0.5993,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.6085571050643921,
"rewards/margins": 1.2699706554412842,
"rewards/rejected": -0.660449206829071,
"step": 660
},
{
"epoch": 0.287522797983049,
"grad_norm": 115.65279317320193,
"learning_rate": 9.282188841201717e-07,
"logits/chosen": -0.5132201910018921,
"logits/rejected": -0.549694836139679,
"logps/chosen": -323.3374938964844,
"logps/rejected": -322.7250061035156,
"loss": 0.6454,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.16215820610523224,
"rewards/margins": 0.9600830078125,
"rewards/rejected": -0.798248291015625,
"step": 670
},
{
"epoch": 0.29181418302757217,
"grad_norm": 102.45490493033104,
"learning_rate": 9.27145922746781e-07,
"logits/chosen": -0.49029541015625,
"logits/rejected": -0.52154541015625,
"logps/chosen": -375.3374938964844,
"logps/rejected": -358.13751220703125,
"loss": 0.5784,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.48070067167282104,
"rewards/margins": 1.1212646961212158,
"rewards/rejected": -0.6394012570381165,
"step": 680
},
{
"epoch": 0.29610556807209526,
"grad_norm": 71.07473549836888,
"learning_rate": 9.260729613733905e-07,
"logits/chosen": -0.4853271543979645,
"logits/rejected": -0.5065673589706421,
"logps/chosen": -378.17498779296875,
"logps/rejected": -362.2250061035156,
"loss": 0.7095,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": 0.543322741985321,
"rewards/margins": 0.8026123046875,
"rewards/rejected": -0.25929564237594604,
"step": 690
},
{
"epoch": 0.3003969531166184,
"grad_norm": 109.60981194919961,
"learning_rate": 9.25e-07,
"logits/chosen": -0.42185670137405396,
"logits/rejected": -0.4507690370082855,
"logps/chosen": -368.70001220703125,
"logps/rejected": -329.07501220703125,
"loss": 0.5381,
"rewards/accuracies": 0.7437499761581421,
"rewards/chosen": 0.49433594942092896,
"rewards/margins": 1.210058569908142,
"rewards/rejected": -0.715771496295929,
"step": 700
},
{
"epoch": 0.3046883381611415,
"grad_norm": 89.04505013063321,
"learning_rate": 9.239270386266093e-07,
"logits/chosen": -0.434173583984375,
"logits/rejected": -0.469259649515152,
"logps/chosen": -347.57501220703125,
"logps/rejected": -329.6499938964844,
"loss": 0.6525,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": 0.39166259765625,
"rewards/margins": 0.98681640625,
"rewards/rejected": -0.5951949954032898,
"step": 710
},
{
"epoch": 0.30897972320566464,
"grad_norm": 101.2686169602893,
"learning_rate": 9.228540772532189e-07,
"logits/chosen": -0.5307220220565796,
"logits/rejected": -0.516613781452179,
"logps/chosen": -356.42498779296875,
"logps/rejected": -339.45001220703125,
"loss": 0.5437,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.6387084722518921,
"rewards/margins": 0.982983410358429,
"rewards/rejected": -0.34521484375,
"step": 720
},
{
"epoch": 0.3132711082501877,
"grad_norm": 138.20748334338063,
"learning_rate": 9.217811158798283e-07,
"logits/chosen": -0.4175048768520355,
"logits/rejected": -0.43641358613967896,
"logps/chosen": -372.1499938964844,
"logps/rejected": -371.79998779296875,
"loss": 0.6532,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": 0.24131163954734802,
"rewards/margins": 0.812853991985321,
"rewards/rejected": -0.571728527545929,
"step": 730
},
{
"epoch": 0.31756249329471087,
"grad_norm": 55.41267518981706,
"learning_rate": 9.207081545064377e-07,
"logits/chosen": -0.42187803983688354,
"logits/rejected": -0.4542236328125,
"logps/chosen": -334.5625,
"logps/rejected": -346.6000061035156,
"loss": 0.4551,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": 0.4122070372104645,
"rewards/margins": 1.5115845203399658,
"rewards/rejected": -1.0981566905975342,
"step": 740
},
{
"epoch": 0.321853878339234,
"grad_norm": 115.35651982235808,
"learning_rate": 9.196351931330472e-07,
"logits/chosen": -0.4146179258823395,
"logits/rejected": -0.4374542236328125,
"logps/chosen": -337.20001220703125,
"logps/rejected": -355.57501220703125,
"loss": 0.5936,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": 0.11771850287914276,
"rewards/margins": 1.1624023914337158,
"rewards/rejected": -1.044854760169983,
"step": 750
},
{
"epoch": 0.3261452633837571,
"grad_norm": 97.98417602949746,
"learning_rate": 9.185622317596566e-07,
"logits/chosen": -0.47843629121780396,
"logits/rejected": -0.46956175565719604,
"logps/chosen": -345.2250061035156,
"logps/rejected": -328.6499938964844,
"loss": 0.5544,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.4692626893520355,
"rewards/margins": 1.1520264148712158,
"rewards/rejected": -0.6825164556503296,
"step": 760
},
{
"epoch": 0.33043664842828024,
"grad_norm": 104.16665949708845,
"learning_rate": 9.17489270386266e-07,
"logits/chosen": -0.568432629108429,
"logits/rejected": -0.575335681438446,
"logps/chosen": -380.3999938964844,
"logps/rejected": -346.29998779296875,
"loss": 0.4675,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": 0.012725830078125,
"rewards/margins": 1.4672119617462158,
"rewards/rejected": -1.4542236328125,
"step": 770
},
{
"epoch": 0.33472803347280333,
"grad_norm": 119.56617553801557,
"learning_rate": 9.164163090128754e-07,
"logits/chosen": -0.553271472454071,
"logits/rejected": -0.57843017578125,
"logps/chosen": -332.13751220703125,
"logps/rejected": -339.375,
"loss": 0.556,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.04550781100988388,
"rewards/margins": 1.414697289466858,
"rewards/rejected": -1.367919921875,
"step": 780
},
{
"epoch": 0.3390194185173265,
"grad_norm": 98.99743825504981,
"learning_rate": 9.15343347639485e-07,
"logits/chosen": -0.5143066644668579,
"logits/rejected": -0.5286620855331421,
"logps/chosen": -375.32501220703125,
"logps/rejected": -368.9624938964844,
"loss": 0.5585,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": -0.15742187201976776,
"rewards/margins": 1.386144995689392,
"rewards/rejected": -1.5444519519805908,
"step": 790
},
{
"epoch": 0.34331080356184956,
"grad_norm": 75.37385349647795,
"learning_rate": 9.142703862660945e-07,
"logits/chosen": -0.5247802734375,
"logits/rejected": -0.52978515625,
"logps/chosen": -348.98748779296875,
"logps/rejected": -346.36248779296875,
"loss": 0.5873,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.5354980230331421,
"rewards/margins": 1.0202515125274658,
"rewards/rejected": -0.4848083555698395,
"step": 800
},
{
"epoch": 0.3476021886063727,
"grad_norm": 90.6096235292697,
"learning_rate": 9.131974248927038e-07,
"logits/chosen": -0.4453979432582855,
"logits/rejected": -0.47803956270217896,
"logps/chosen": -373.7749938964844,
"logps/rejected": -375.6499938964844,
"loss": 0.5592,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.302276611328125,
"rewards/margins": 1.0711669921875,
"rewards/rejected": -0.768969714641571,
"step": 810
},
{
"epoch": 0.35189357365089585,
"grad_norm": 99.82672620444873,
"learning_rate": 9.121244635193133e-07,
"logits/chosen": -0.5496581792831421,
"logits/rejected": -0.542236328125,
"logps/chosen": -374.7749938964844,
"logps/rejected": -350.9750061035156,
"loss": 0.4969,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.16860350966453552,
"rewards/margins": 1.4805419445037842,
"rewards/rejected": -1.6498534679412842,
"step": 820
},
{
"epoch": 0.35618495869541894,
"grad_norm": 94.16289003441854,
"learning_rate": 9.110515021459227e-07,
"logits/chosen": -0.48774415254592896,
"logits/rejected": -0.490966796875,
"logps/chosen": -340.625,
"logps/rejected": -351.2749938964844,
"loss": 0.7307,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": -0.72174072265625,
"rewards/margins": 0.8165343999862671,
"rewards/rejected": -1.5394287109375,
"step": 830
},
{
"epoch": 0.3604763437399421,
"grad_norm": 104.945667417502,
"learning_rate": 9.099785407725321e-07,
"logits/chosen": -0.501965343952179,
"logits/rejected": -0.529003918170929,
"logps/chosen": -343.36248779296875,
"logps/rejected": -337.7250061035156,
"loss": 0.5847,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.06689453125,
"rewards/margins": 1.0524413585662842,
"rewards/rejected": -1.1195068359375,
"step": 840
},
{
"epoch": 0.3647677287844652,
"grad_norm": 141.3638974601805,
"learning_rate": 9.089055793991416e-07,
"logits/chosen": -0.4378768801689148,
"logits/rejected": -0.46462708711624146,
"logps/chosen": -334.07501220703125,
"logps/rejected": -331.79998779296875,
"loss": 0.6944,
"rewards/accuracies": 0.6187499761581421,
"rewards/chosen": 0.35230714082717896,
"rewards/margins": 0.8697754144668579,
"rewards/rejected": -0.5178467035293579,
"step": 850
},
{
"epoch": 0.3690591138289883,
"grad_norm": 98.86332296676377,
"learning_rate": 9.07832618025751e-07,
"logits/chosen": -0.4075004458427429,
"logits/rejected": -0.42329102754592896,
"logps/chosen": -327.0874938964844,
"logps/rejected": -337.57501220703125,
"loss": 0.5143,
"rewards/accuracies": 0.71875,
"rewards/chosen": 1.0659058094024658,
"rewards/margins": 1.3506591320037842,
"rewards/rejected": -0.2843566834926605,
"step": 860
},
{
"epoch": 0.3733504988735114,
"grad_norm": 143.52865264201142,
"learning_rate": 9.067596566523604e-07,
"logits/chosen": -0.47900390625,
"logits/rejected": -0.5025634765625,
"logps/chosen": -325.375,
"logps/rejected": -306.1499938964844,
"loss": 0.6415,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": 0.839221179485321,
"rewards/margins": 0.882495105266571,
"rewards/rejected": -0.04320068284869194,
"step": 870
},
{
"epoch": 0.37764188391803455,
"grad_norm": 108.44675985314916,
"learning_rate": 9.056866952789699e-07,
"logits/chosen": -0.492462158203125,
"logits/rejected": -0.5123046636581421,
"logps/chosen": -371.01251220703125,
"logps/rejected": -341.8999938964844,
"loss": 0.5498,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": 0.5734497308731079,
"rewards/margins": 1.064050316810608,
"rewards/rejected": -0.49089354276657104,
"step": 880
},
{
"epoch": 0.3819332689625577,
"grad_norm": 85.83065193263236,
"learning_rate": 9.046137339055794e-07,
"logits/chosen": -0.47416383028030396,
"logits/rejected": -0.5217592120170593,
"logps/chosen": -376.5874938964844,
"logps/rejected": -326.8999938964844,
"loss": 0.6264,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": 0.06551513820886612,
"rewards/margins": 0.9853760004043579,
"rewards/rejected": -0.919665515422821,
"step": 890
},
{
"epoch": 0.3862246540070808,
"grad_norm": 112.8340748218402,
"learning_rate": 9.035407725321889e-07,
"logits/chosen": -0.5336059331893921,
"logits/rejected": -0.5383239984512329,
"logps/chosen": -380.0,
"logps/rejected": -365.75,
"loss": 0.7112,
"rewards/accuracies": 0.612500011920929,
"rewards/chosen": -0.01059570349752903,
"rewards/margins": 1.0574462413787842,
"rewards/rejected": -1.068023681640625,
"step": 900
},
{
"epoch": 0.3905160390516039,
"grad_norm": 104.60729787920864,
"learning_rate": 9.024678111587982e-07,
"logits/chosen": -0.4833007752895355,
"logits/rejected": -0.5191894769668579,
"logps/chosen": -317.51251220703125,
"logps/rejected": -328.86248779296875,
"loss": 0.487,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": 0.4936767518520355,
"rewards/margins": 1.44757080078125,
"rewards/rejected": -0.952838122844696,
"step": 910
},
{
"epoch": 0.394807424096127,
"grad_norm": 134.56374098328996,
"learning_rate": 9.013948497854077e-07,
"logits/chosen": -0.560375988483429,
"logits/rejected": -0.5675293207168579,
"logps/chosen": -396.6000061035156,
"logps/rejected": -352.8500061035156,
"loss": 0.6012,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.537890613079071,
"rewards/margins": 1.114013671875,
"rewards/rejected": -0.5757080316543579,
"step": 920
},
{
"epoch": 0.39909880914065016,
"grad_norm": 89.61196386462339,
"learning_rate": 9.003218884120171e-07,
"logits/chosen": -0.47153931856155396,
"logits/rejected": -0.49626463651657104,
"logps/chosen": -390.3999938964844,
"logps/rejected": -380.67498779296875,
"loss": 0.5459,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.09894714504480362,
"rewards/margins": 1.4040648937225342,
"rewards/rejected": -1.304443359375,
"step": 930
},
{
"epoch": 0.40339019418517325,
"grad_norm": 82.28967332012682,
"learning_rate": 8.992489270386265e-07,
"logits/chosen": -0.524951159954071,
"logits/rejected": -0.5859740972518921,
"logps/chosen": -372.20001220703125,
"logps/rejected": -372.5,
"loss": 0.5709,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.4099975526332855,
"rewards/margins": 1.3982422351837158,
"rewards/rejected": -0.987438976764679,
"step": 940
},
{
"epoch": 0.4076815792296964,
"grad_norm": 134.56483869217476,
"learning_rate": 8.981759656652361e-07,
"logits/chosen": -0.49836426973342896,
"logits/rejected": -0.5463012456893921,
"logps/chosen": -369.9750061035156,
"logps/rejected": -345.125,
"loss": 0.592,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": 0.2688537538051605,
"rewards/margins": 1.27587890625,
"rewards/rejected": -1.006103515625,
"step": 950
},
{
"epoch": 0.4119729642742195,
"grad_norm": 141.27056328687465,
"learning_rate": 8.971030042918455e-07,
"logits/chosen": -0.43629151582717896,
"logits/rejected": -0.47950440645217896,
"logps/chosen": -383.5249938964844,
"logps/rejected": -338.57501220703125,
"loss": 0.731,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": 0.39167481660842896,
"rewards/margins": 1.1161620616912842,
"rewards/rejected": -0.7248779535293579,
"step": 960
},
{
"epoch": 0.4162643493187426,
"grad_norm": 103.51897784625359,
"learning_rate": 8.960300429184549e-07,
"logits/chosen": -0.498382568359375,
"logits/rejected": -0.516064465045929,
"logps/chosen": -372.82501220703125,
"logps/rejected": -358.0249938964844,
"loss": 0.597,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.18765106797218323,
"rewards/margins": 1.342736840248108,
"rewards/rejected": -1.1550414562225342,
"step": 970
},
{
"epoch": 0.42055573436326577,
"grad_norm": 152.1051504836179,
"learning_rate": 8.949570815450643e-07,
"logits/chosen": -0.4586181640625,
"logits/rejected": -0.49034422636032104,
"logps/chosen": -309.75,
"logps/rejected": -317.76251220703125,
"loss": 0.6408,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.04051513597369194,
"rewards/margins": 1.1795654296875,
"rewards/rejected": -1.1399352550506592,
"step": 980
},
{
"epoch": 0.42484711940778885,
"grad_norm": 123.64678035860396,
"learning_rate": 8.938841201716738e-07,
"logits/chosen": -0.46697998046875,
"logits/rejected": -0.475045770406723,
"logps/chosen": -411.11248779296875,
"logps/rejected": -369.6499938964844,
"loss": 0.6128,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.15746459364891052,
"rewards/margins": 1.188378930091858,
"rewards/rejected": -1.03192138671875,
"step": 990
},
{
"epoch": 0.429138504452312,
"grad_norm": 95.25459373166133,
"learning_rate": 8.928111587982832e-07,
"logits/chosen": -0.507373034954071,
"logits/rejected": -0.551562488079071,
"logps/chosen": -374.1000061035156,
"logps/rejected": -324.29998779296875,
"loss": 0.622,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.04002685472369194,
"rewards/margins": 1.050103783607483,
"rewards/rejected": -1.089263916015625,
"step": 1000
},
{
"epoch": 0.4334298894968351,
"grad_norm": 115.34806962949547,
"learning_rate": 8.917381974248926e-07,
"logits/chosen": -0.5554443597793579,
"logits/rejected": -0.5665038824081421,
"logps/chosen": -417.0,
"logps/rejected": -361.29998779296875,
"loss": 0.5668,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": 0.2359161376953125,
"rewards/margins": 1.0950195789337158,
"rewards/rejected": -0.8587890863418579,
"step": 1010
},
{
"epoch": 0.43772127454135823,
"grad_norm": 91.53553385211777,
"learning_rate": 8.906652360515021e-07,
"logits/chosen": -0.43243408203125,
"logits/rejected": -0.46153563261032104,
"logps/chosen": -378.0,
"logps/rejected": -372.67498779296875,
"loss": 0.5821,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.08709716796875,
"rewards/margins": 1.1092040538787842,
"rewards/rejected": -1.0213196277618408,
"step": 1020
},
{
"epoch": 0.4420126595858813,
"grad_norm": 109.75710674669165,
"learning_rate": 8.895922746781116e-07,
"logits/chosen": -0.506561279296875,
"logits/rejected": -0.5144714117050171,
"logps/chosen": -371.67498779296875,
"logps/rejected": -349.0874938964844,
"loss": 0.5648,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.05256347730755806,
"rewards/margins": 1.103796362876892,
"rewards/rejected": -1.0504150390625,
"step": 1030
},
{
"epoch": 0.44630404463040446,
"grad_norm": 93.91961654807437,
"learning_rate": 8.88519313304721e-07,
"logits/chosen": -0.47314453125,
"logits/rejected": -0.5016113519668579,
"logps/chosen": -386.92498779296875,
"logps/rejected": -379.04998779296875,
"loss": 0.5926,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": 0.16387939453125,
"rewards/margins": 1.212377905845642,
"rewards/rejected": -1.049780249595642,
"step": 1040
},
{
"epoch": 0.4505954296749276,
"grad_norm": 90.52997225614212,
"learning_rate": 8.874463519313305e-07,
"logits/chosen": -0.44517821073532104,
"logits/rejected": -0.4933105409145355,
"logps/chosen": -395.3500061035156,
"logps/rejected": -342.1000061035156,
"loss": 0.6056,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.11962280422449112,
"rewards/margins": 1.24884033203125,
"rewards/rejected": -1.1293456554412842,
"step": 1050
},
{
"epoch": 0.4548868147194507,
"grad_norm": 74.04010129210053,
"learning_rate": 8.863733905579399e-07,
"logits/chosen": -0.41621702909469604,
"logits/rejected": -0.4658203125,
"logps/chosen": -338.4750061035156,
"logps/rejected": -331.67498779296875,
"loss": 0.6029,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": 0.12017822265625,
"rewards/margins": 1.0793945789337158,
"rewards/rejected": -0.9591614007949829,
"step": 1060
},
{
"epoch": 0.45917819976397384,
"grad_norm": 74.4564060165688,
"learning_rate": 8.853004291845493e-07,
"logits/chosen": -0.546459972858429,
"logits/rejected": -0.611010730266571,
"logps/chosen": -357.73748779296875,
"logps/rejected": -333.5,
"loss": 0.4912,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0178680419921875,
"rewards/margins": 1.5290710926055908,
"rewards/rejected": -1.5110962390899658,
"step": 1070
},
{
"epoch": 0.4634695848084969,
"grad_norm": 98.24596655627826,
"learning_rate": 8.842274678111587e-07,
"logits/chosen": -0.5308777093887329,
"logits/rejected": -0.537243664264679,
"logps/chosen": -367.5625,
"logps/rejected": -351.375,
"loss": 0.4987,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.4163879454135895,
"rewards/margins": 1.558447241783142,
"rewards/rejected": -1.9744141101837158,
"step": 1080
},
{
"epoch": 0.46776096985302007,
"grad_norm": 131.9870699092233,
"learning_rate": 8.831545064377682e-07,
"logits/chosen": -0.538891613483429,
"logits/rejected": -0.588305652141571,
"logps/chosen": -412.07501220703125,
"logps/rejected": -380.20001220703125,
"loss": 0.7044,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -0.9598938226699829,
"rewards/margins": 0.9187988042831421,
"rewards/rejected": -1.878564476966858,
"step": 1090
},
{
"epoch": 0.47205235489754316,
"grad_norm": 115.58651937418213,
"learning_rate": 8.820815450643776e-07,
"logits/chosen": -0.510485827922821,
"logits/rejected": -0.5465087890625,
"logps/chosen": -356.1875,
"logps/rejected": -373.9624938964844,
"loss": 0.5985,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.9252868890762329,
"rewards/margins": 1.1397216320037842,
"rewards/rejected": -2.063671827316284,
"step": 1100
},
{
"epoch": 0.4763437399420663,
"grad_norm": 159.2697928214491,
"learning_rate": 8.81008583690987e-07,
"logits/chosen": -0.4638732969760895,
"logits/rejected": -0.48553466796875,
"logps/chosen": -364.3500061035156,
"logps/rejected": -321.57501220703125,
"loss": 0.6099,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.53936767578125,
"rewards/margins": 0.917163074016571,
"rewards/rejected": -1.4571044445037842,
"step": 1110
},
{
"epoch": 0.48063512498658945,
"grad_norm": 95.382031633549,
"learning_rate": 8.799356223175966e-07,
"logits/chosen": -0.497894287109375,
"logits/rejected": -0.504931628704071,
"logps/chosen": -342.6000061035156,
"logps/rejected": -355.7749938964844,
"loss": 0.6026,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": 0.2616943418979645,
"rewards/margins": 1.0916259288787842,
"rewards/rejected": -0.830029308795929,
"step": 1120
},
{
"epoch": 0.48492651003111253,
"grad_norm": 71.83647371428191,
"learning_rate": 8.788626609442059e-07,
"logits/chosen": -0.512347400188446,
"logits/rejected": -0.5821593999862671,
"logps/chosen": -355.9375,
"logps/rejected": -348.76251220703125,
"loss": 0.5979,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.4642578065395355,
"rewards/margins": 1.021484375,
"rewards/rejected": -0.5578094720840454,
"step": 1130
},
{
"epoch": 0.4892178950756357,
"grad_norm": 91.19027065620813,
"learning_rate": 8.777896995708154e-07,
"logits/chosen": -0.532092273235321,
"logits/rejected": -0.549420177936554,
"logps/chosen": -361.04998779296875,
"logps/rejected": -364.2250061035156,
"loss": 0.585,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": 0.675488293170929,
"rewards/margins": 1.165808081626892,
"rewards/rejected": -0.4899353086948395,
"step": 1140
},
{
"epoch": 0.49350928012015877,
"grad_norm": 115.32812364907116,
"learning_rate": 8.767167381974249e-07,
"logits/chosen": -0.41058349609375,
"logits/rejected": -0.4657699465751648,
"logps/chosen": -350.4750061035156,
"logps/rejected": -356.11248779296875,
"loss": 0.6066,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.3958496153354645,
"rewards/margins": 1.008276343345642,
"rewards/rejected": -0.612597644329071,
"step": 1150
},
{
"epoch": 0.4978006651646819,
"grad_norm": 78.0197602345477,
"learning_rate": 8.756437768240343e-07,
"logits/chosen": -0.48851317167282104,
"logits/rejected": -0.509521484375,
"logps/chosen": -377.0874938964844,
"logps/rejected": -352.57501220703125,
"loss": 0.5534,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": 0.22884520888328552,
"rewards/margins": 1.447045922279358,
"rewards/rejected": -1.21844482421875,
"step": 1160
},
{
"epoch": 0.502092050209205,
"grad_norm": 98.64277713762311,
"learning_rate": 8.745708154506437e-07,
"logits/chosen": -0.522113025188446,
"logits/rejected": -0.574328601360321,
"logps/chosen": -376.1499938964844,
"logps/rejected": -376.4750061035156,
"loss": 0.5435,
"rewards/accuracies": 0.7437499761581421,
"rewards/chosen": 0.15298843383789062,
"rewards/margins": 1.590429663658142,
"rewards/rejected": -1.437719702720642,
"step": 1170
},
{
"epoch": 0.5063834352537281,
"grad_norm": 106.05493802876313,
"learning_rate": 8.734978540772531e-07,
"logits/chosen": -0.445648193359375,
"logits/rejected": -0.46367186307907104,
"logps/chosen": -381.70001220703125,
"logps/rejected": -372.5,
"loss": 0.7092,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.11246337741613388,
"rewards/margins": 1.025366187095642,
"rewards/rejected": -1.136804223060608,
"step": 1180
},
{
"epoch": 0.5106748202982513,
"grad_norm": 115.26043535385436,
"learning_rate": 8.724248927038627e-07,
"logits/chosen": -0.39453125,
"logits/rejected": -0.41694337129592896,
"logps/chosen": -327.5375061035156,
"logps/rejected": -354.375,
"loss": 0.5654,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.74749755859375,
"rewards/margins": 1.164697289466858,
"rewards/rejected": -0.41730958223342896,
"step": 1190
},
{
"epoch": 0.5149662053427744,
"grad_norm": 113.80958925768223,
"learning_rate": 8.713519313304721e-07,
"logits/chosen": -0.493438720703125,
"logits/rejected": -0.534472644329071,
"logps/chosen": -381.01251220703125,
"logps/rejected": -353.70001220703125,
"loss": 0.5776,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": 0.4181884825229645,
"rewards/margins": 0.985180675983429,
"rewards/rejected": -0.5670410394668579,
"step": 1200
},
{
"epoch": 0.5192575903872975,
"grad_norm": 64.87761934202179,
"learning_rate": 8.702789699570815e-07,
"logits/chosen": -0.5803467035293579,
"logits/rejected": -0.5775787234306335,
"logps/chosen": -354.9750061035156,
"logps/rejected": -345.7749938964844,
"loss": 0.6283,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.09605102241039276,
"rewards/margins": 0.893798828125,
"rewards/rejected": -0.7971435785293579,
"step": 1210
},
{
"epoch": 0.5235489754318207,
"grad_norm": 75.79881167922929,
"learning_rate": 8.69206008583691e-07,
"logits/chosen": -0.524340808391571,
"logits/rejected": -0.605224609375,
"logps/chosen": -403.6499938964844,
"logps/rejected": -350.7749938964844,
"loss": 0.5637,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.03439941257238388,
"rewards/margins": 1.2552368640899658,
"rewards/rejected": -1.220422387123108,
"step": 1220
},
{
"epoch": 0.5278403604763438,
"grad_norm": 200.8530863955299,
"learning_rate": 8.681330472103003e-07,
"logits/chosen": -0.55548095703125,
"logits/rejected": -0.5864623785018921,
"logps/chosen": -353.67498779296875,
"logps/rejected": -305.29998779296875,
"loss": 0.6713,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": 0.28569334745407104,
"rewards/margins": 1.134545922279358,
"rewards/rejected": -0.8502563238143921,
"step": 1230
},
{
"epoch": 0.5321317455208668,
"grad_norm": 97.55383490779244,
"learning_rate": 8.670600858369098e-07,
"logits/chosen": -0.45197755098342896,
"logits/rejected": -0.49714356660842896,
"logps/chosen": -329.5,
"logps/rejected": -329.73748779296875,
"loss": 0.5312,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.22989502549171448,
"rewards/margins": 1.3463256359100342,
"rewards/rejected": -1.1160156726837158,
"step": 1240
},
{
"epoch": 0.5364231305653899,
"grad_norm": 85.32964636123666,
"learning_rate": 8.659871244635193e-07,
"logits/chosen": -0.4923034608364105,
"logits/rejected": -0.5574706792831421,
"logps/chosen": -346.5375061035156,
"logps/rejected": -351.48748779296875,
"loss": 0.5077,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.21806640923023224,
"rewards/margins": 1.7045409679412842,
"rewards/rejected": -1.487463355064392,
"step": 1250
},
{
"epoch": 0.5407145156099131,
"grad_norm": 122.6983432711232,
"learning_rate": 8.649141630901287e-07,
"logits/chosen": -0.551116943359375,
"logits/rejected": -0.5929931402206421,
"logps/chosen": -394.88751220703125,
"logps/rejected": -373.61248779296875,
"loss": 0.6315,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.910290539264679,
"rewards/margins": 1.1508057117462158,
"rewards/rejected": -2.061230421066284,
"step": 1260
},
{
"epoch": 0.5450059006544362,
"grad_norm": 79.73902746855065,
"learning_rate": 8.638412017167382e-07,
"logits/chosen": -0.47783201932907104,
"logits/rejected": -0.5023193359375,
"logps/chosen": -375.625,
"logps/rejected": -367.07501220703125,
"loss": 0.511,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": -0.6886962652206421,
"rewards/margins": 1.309088110923767,
"rewards/rejected": -1.99755859375,
"step": 1270
},
{
"epoch": 0.5492972856989593,
"grad_norm": 76.48265299898162,
"learning_rate": 8.627682403433476e-07,
"logits/chosen": -0.5455322265625,
"logits/rejected": -0.5739501714706421,
"logps/chosen": -408.25,
"logps/rejected": -354.9624938964844,
"loss": 0.6486,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.799389660358429,
"rewards/margins": 0.9174438714981079,
"rewards/rejected": -1.7162597179412842,
"step": 1280
},
{
"epoch": 0.5535886707434825,
"grad_norm": 91.0745408997436,
"learning_rate": 8.616952789699571e-07,
"logits/chosen": -0.4973998963832855,
"logits/rejected": -0.573132336139679,
"logps/chosen": -378.2250061035156,
"logps/rejected": -350.32501220703125,
"loss": 0.5263,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": -0.21334533393383026,
"rewards/margins": 1.448999047279358,
"rewards/rejected": -1.661865234375,
"step": 1290
},
{
"epoch": 0.5578800557880056,
"grad_norm": 153.60675520341502,
"learning_rate": 8.606223175965665e-07,
"logits/chosen": -0.43608397245407104,
"logits/rejected": -0.4373107850551605,
"logps/chosen": -340.5874938964844,
"logps/rejected": -347.82501220703125,
"loss": 0.643,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": -0.29754638671875,
"rewards/margins": 1.2620849609375,
"rewards/rejected": -1.560156226158142,
"step": 1300
},
{
"epoch": 0.5621714408325287,
"grad_norm": 132.43446554600487,
"learning_rate": 8.595493562231759e-07,
"logits/chosen": -0.4892822206020355,
"logits/rejected": -0.526074230670929,
"logps/chosen": -365.92498779296875,
"logps/rejected": -343.42498779296875,
"loss": 0.7188,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -0.16191406548023224,
"rewards/margins": 0.955456554889679,
"rewards/rejected": -1.1182372570037842,
"step": 1310
},
{
"epoch": 0.5664628258770518,
"grad_norm": 71.70573005978581,
"learning_rate": 8.584763948497854e-07,
"logits/chosen": -0.543383777141571,
"logits/rejected": -0.541186511516571,
"logps/chosen": -360.95001220703125,
"logps/rejected": -371.45001220703125,
"loss": 0.6053,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.3445373475551605,
"rewards/margins": 0.891772449016571,
"rewards/rejected": -0.5476318597793579,
"step": 1320
},
{
"epoch": 0.570754210921575,
"grad_norm": 127.82314313548048,
"learning_rate": 8.574034334763947e-07,
"logits/chosen": -0.48707884550094604,
"logits/rejected": -0.5375640988349915,
"logps/chosen": -365.1875,
"logps/rejected": -366.67498779296875,
"loss": 0.5814,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.08065185695886612,
"rewards/margins": 1.303247094154358,
"rewards/rejected": -1.3848145008087158,
"step": 1330
},
{
"epoch": 0.575045595966098,
"grad_norm": 107.88477863428349,
"learning_rate": 8.563304721030042e-07,
"logits/chosen": -0.526837170124054,
"logits/rejected": -0.546130359172821,
"logps/chosen": -352.82501220703125,
"logps/rejected": -352.32501220703125,
"loss": 0.5981,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": -0.06484375149011612,
"rewards/margins": 1.154577612876892,
"rewards/rejected": -1.220068335533142,
"step": 1340
},
{
"epoch": 0.5793369810106211,
"grad_norm": 82.1472115579418,
"learning_rate": 8.552575107296138e-07,
"logits/chosen": -0.634167492389679,
"logits/rejected": -0.673510730266571,
"logps/chosen": -403.0874938964844,
"logps/rejected": -376.0249938964844,
"loss": 0.6074,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": -0.0027954101096838713,
"rewards/margins": 1.2101562023162842,
"rewards/rejected": -1.2136719226837158,
"step": 1350
},
{
"epoch": 0.5836283660551443,
"grad_norm": 94.92143754062582,
"learning_rate": 8.541845493562231e-07,
"logits/chosen": -0.49714356660842896,
"logits/rejected": -0.5233856439590454,
"logps/chosen": -333.3374938964844,
"logps/rejected": -327.25,
"loss": 0.5949,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.05092773586511612,
"rewards/margins": 1.311303734779358,
"rewards/rejected": -1.361291527748108,
"step": 1360
},
{
"epoch": 0.5879197510996674,
"grad_norm": 94.34744735913843,
"learning_rate": 8.531115879828326e-07,
"logits/chosen": -0.5505005121231079,
"logits/rejected": -0.576000988483429,
"logps/chosen": -370.6000061035156,
"logps/rejected": -357.29998779296875,
"loss": 0.6575,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.18602295219898224,
"rewards/margins": 1.278955101966858,
"rewards/rejected": -1.464624047279358,
"step": 1370
},
{
"epoch": 0.5922111361441905,
"grad_norm": 127.09428801599846,
"learning_rate": 8.52038626609442e-07,
"logits/chosen": -0.4859985411167145,
"logits/rejected": -0.5118652582168579,
"logps/chosen": -337.5874938964844,
"logps/rejected": -351.2875061035156,
"loss": 0.6361,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.3132003843784332,
"rewards/margins": 1.212499976158142,
"rewards/rejected": -1.5251861810684204,
"step": 1380
},
{
"epoch": 0.5965025211887136,
"grad_norm": 64.80417600604287,
"learning_rate": 8.509656652360515e-07,
"logits/chosen": -0.5366455316543579,
"logits/rejected": -0.576123058795929,
"logps/chosen": -373.79998779296875,
"logps/rejected": -379.1875,
"loss": 0.5529,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0067962645553052425,
"rewards/margins": 1.2827637195587158,
"rewards/rejected": -1.2896331548690796,
"step": 1390
},
{
"epoch": 0.6007939062332368,
"grad_norm": 97.83397912112129,
"learning_rate": 8.498927038626609e-07,
"logits/chosen": -0.52276611328125,
"logits/rejected": -0.5662841796875,
"logps/chosen": -363.375,
"logps/rejected": -359.625,
"loss": 0.6168,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.23829345405101776,
"rewards/margins": 1.1818726062774658,
"rewards/rejected": -0.9430511593818665,
"step": 1400
},
{
"epoch": 0.6050852912777599,
"grad_norm": 112.3779143546819,
"learning_rate": 8.488197424892703e-07,
"logits/chosen": -0.4321044981479645,
"logits/rejected": -0.46345824003219604,
"logps/chosen": -372.20623779296875,
"logps/rejected": -337.1875,
"loss": 0.5327,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.12424316257238388,
"rewards/margins": 1.40032958984375,
"rewards/rejected": -1.2748901844024658,
"step": 1410
},
{
"epoch": 0.609376676322283,
"grad_norm": 72.4529126410346,
"learning_rate": 8.477467811158799e-07,
"logits/chosen": -0.4897705018520355,
"logits/rejected": -0.52484130859375,
"logps/chosen": -327.79998779296875,
"logps/rejected": -329.67498779296875,
"loss": 0.6019,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.06064758449792862,
"rewards/margins": 1.131445288658142,
"rewards/rejected": -1.071081519126892,
"step": 1420
},
{
"epoch": 0.6136680613668062,
"grad_norm": 97.63216460404503,
"learning_rate": 8.466738197424892e-07,
"logits/chosen": -0.48497313261032104,
"logits/rejected": -0.5263916254043579,
"logps/chosen": -357.67498779296875,
"logps/rejected": -331.375,
"loss": 0.6787,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": 0.07767333835363388,
"rewards/margins": 1.00714111328125,
"rewards/rejected": -0.929492175579071,
"step": 1430
},
{
"epoch": 0.6179594464113293,
"grad_norm": 57.5331067814223,
"learning_rate": 8.456008583690987e-07,
"logits/chosen": -0.5661865472793579,
"logits/rejected": -0.6107543706893921,
"logps/chosen": -346.6625061035156,
"logps/rejected": -352.7250061035156,
"loss": 0.6395,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.14810791611671448,
"rewards/margins": 1.1807372570037842,
"rewards/rejected": -1.32977294921875,
"step": 1440
},
{
"epoch": 0.6222508314558524,
"grad_norm": 69.50617792157094,
"learning_rate": 8.445278969957082e-07,
"logits/chosen": -0.4361205995082855,
"logits/rejected": -0.4748779237270355,
"logps/chosen": -355.75,
"logps/rejected": -347.5249938964844,
"loss": 0.5356,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.3649047911167145,
"rewards/margins": 1.450170874595642,
"rewards/rejected": -1.0839111804962158,
"step": 1450
},
{
"epoch": 0.6265422165003754,
"grad_norm": 68.13949614065807,
"learning_rate": 8.434549356223175e-07,
"logits/chosen": -0.57635498046875,
"logits/rejected": -0.6020752191543579,
"logps/chosen": -358.9750061035156,
"logps/rejected": -343.17498779296875,
"loss": 0.609,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.4049972593784332,
"rewards/margins": 1.356420874595642,
"rewards/rejected": -0.9520202875137329,
"step": 1460
},
{
"epoch": 0.6308336015448986,
"grad_norm": 99.54853354184904,
"learning_rate": 8.42381974248927e-07,
"logits/chosen": -0.54022216796875,
"logits/rejected": -0.5438476800918579,
"logps/chosen": -365.73748779296875,
"logps/rejected": -353.42498779296875,
"loss": 0.6873,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.16910400986671448,
"rewards/margins": 0.8871093988418579,
"rewards/rejected": -0.71746826171875,
"step": 1470
},
{
"epoch": 0.6351249865894217,
"grad_norm": 83.2495790704316,
"learning_rate": 8.413090128755364e-07,
"logits/chosen": -0.550823986530304,
"logits/rejected": -0.5851806402206421,
"logps/chosen": -374.54998779296875,
"logps/rejected": -344.04998779296875,
"loss": 0.7087,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.4762206971645355,
"rewards/margins": 0.963916003704071,
"rewards/rejected": -1.440100073814392,
"step": 1480
},
{
"epoch": 0.6394163716339448,
"grad_norm": 91.46916470585484,
"learning_rate": 8.402360515021459e-07,
"logits/chosen": -0.52392578125,
"logits/rejected": -0.5739990472793579,
"logps/chosen": -378.57501220703125,
"logps/rejected": -373.42498779296875,
"loss": 0.5314,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": -0.6462768316268921,
"rewards/margins": 1.498559594154358,
"rewards/rejected": -2.1455078125,
"step": 1490
},
{
"epoch": 0.643707756678468,
"grad_norm": 130.29345838295373,
"learning_rate": 8.391630901287554e-07,
"logits/chosen": -0.42219239473342896,
"logits/rejected": -0.46629637479782104,
"logps/chosen": -351.5874938964844,
"logps/rejected": -351.07501220703125,
"loss": 0.6083,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.30372923612594604,
"rewards/margins": 1.2931396961212158,
"rewards/rejected": -1.5969970226287842,
"step": 1500
},
{
"epoch": 0.6479991417229911,
"grad_norm": 87.98382679498306,
"learning_rate": 8.380901287553648e-07,
"logits/chosen": -0.4512939453125,
"logits/rejected": -0.45451050996780396,
"logps/chosen": -372.92498779296875,
"logps/rejected": -350.5249938964844,
"loss": 0.6227,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.4544677734375,
"rewards/margins": 1.4044189453125,
"rewards/rejected": -1.8577392101287842,
"step": 1510
},
{
"epoch": 0.6522905267675142,
"grad_norm": 69.90835845853988,
"learning_rate": 8.370171673819743e-07,
"logits/chosen": -0.47783201932907104,
"logits/rejected": -0.48542481660842896,
"logps/chosen": -374.0249938964844,
"logps/rejected": -346.0,
"loss": 0.6425,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.5445556640625,
"rewards/margins": 1.402075171470642,
"rewards/rejected": -1.945703148841858,
"step": 1520
},
{
"epoch": 0.6565819118120373,
"grad_norm": 74.9862455300779,
"learning_rate": 8.359442060085836e-07,
"logits/chosen": -0.4558349549770355,
"logits/rejected": -0.4989990293979645,
"logps/chosen": -363.4750061035156,
"logps/rejected": -364.17498779296875,
"loss": 0.5358,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": -0.29169923067092896,
"rewards/margins": 1.52032470703125,
"rewards/rejected": -1.8122985363006592,
"step": 1530
},
{
"epoch": 0.6608732968565605,
"grad_norm": 66.70997081258484,
"learning_rate": 8.348712446351931e-07,
"logits/chosen": -0.49382323026657104,
"logits/rejected": -0.509033203125,
"logps/chosen": -343.6875,
"logps/rejected": -349.9750061035156,
"loss": 0.5414,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": -0.3521972596645355,
"rewards/margins": 1.3031494617462158,
"rewards/rejected": -1.6546630859375,
"step": 1540
},
{
"epoch": 0.6651646819010836,
"grad_norm": 92.37399732783172,
"learning_rate": 8.337982832618026e-07,
"logits/chosen": -0.49000245332717896,
"logits/rejected": -0.5064147710800171,
"logps/chosen": -354.7124938964844,
"logps/rejected": -343.42498779296875,
"loss": 0.5505,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": -0.3075927793979645,
"rewards/margins": 1.5106933116912842,
"rewards/rejected": -1.818933129310608,
"step": 1550
},
{
"epoch": 0.6694560669456067,
"grad_norm": 107.0779843087361,
"learning_rate": 8.327253218884119e-07,
"logits/chosen": -0.4959472715854645,
"logits/rejected": -0.548205554485321,
"logps/chosen": -389.79998779296875,
"logps/rejected": -370.70001220703125,
"loss": 0.6266,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.4276229739189148,
"rewards/margins": 1.133325219154358,
"rewards/rejected": -1.56103515625,
"step": 1560
},
{
"epoch": 0.6737474519901299,
"grad_norm": 71.25240887690347,
"learning_rate": 8.316523605150214e-07,
"logits/chosen": -0.49489134550094604,
"logits/rejected": -0.545239269733429,
"logps/chosen": -385.0,
"logps/rejected": -357.11248779296875,
"loss": 0.5734,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": -0.11707153171300888,
"rewards/margins": 1.5208251476287842,
"rewards/rejected": -1.63751220703125,
"step": 1570
},
{
"epoch": 0.678038837034653,
"grad_norm": 133.35487990624426,
"learning_rate": 8.305793991416309e-07,
"logits/chosen": -0.4952392578125,
"logits/rejected": -0.561535656452179,
"logps/chosen": -379.625,
"logps/rejected": -416.5249938964844,
"loss": 0.6352,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.49039918184280396,
"rewards/margins": 1.2760498523712158,
"rewards/rejected": -1.7668273448944092,
"step": 1580
},
{
"epoch": 0.682330222079176,
"grad_norm": 102.2630137778118,
"learning_rate": 8.295064377682403e-07,
"logits/chosen": -0.4881347715854645,
"logits/rejected": -0.5366576910018921,
"logps/chosen": -355.0,
"logps/rejected": -347.4750061035156,
"loss": 0.5743,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": -0.4215942323207855,
"rewards/margins": 1.5192992687225342,
"rewards/rejected": -1.940954566001892,
"step": 1590
},
{
"epoch": 0.6866216071236991,
"grad_norm": 124.30570547005117,
"learning_rate": 8.284334763948498e-07,
"logits/chosen": -0.41212159395217896,
"logits/rejected": -0.4427490234375,
"logps/chosen": -348.6499938964844,
"logps/rejected": -353.42498779296875,
"loss": 0.6294,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.49810487031936646,
"rewards/margins": 1.0903809070587158,
"rewards/rejected": -1.588433861732483,
"step": 1600
},
{
"epoch": 0.6909129921682223,
"grad_norm": 77.9879074432851,
"learning_rate": 8.273605150214592e-07,
"logits/chosen": -0.43266600370407104,
"logits/rejected": -0.48729246854782104,
"logps/chosen": -352.07501220703125,
"logps/rejected": -370.04998779296875,
"loss": 0.6644,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.3375000059604645,
"rewards/margins": 0.8544921875,
"rewards/rejected": -1.192346215248108,
"step": 1610
},
{
"epoch": 0.6952043772127454,
"grad_norm": 96.49390855559005,
"learning_rate": 8.262875536480687e-07,
"logits/chosen": -0.5049682855606079,
"logits/rejected": -0.5408996343612671,
"logps/chosen": -370.70001220703125,
"logps/rejected": -356.6499938964844,
"loss": 0.4994,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": -0.23572388291358948,
"rewards/margins": 1.4106934070587158,
"rewards/rejected": -1.644799828529358,
"step": 1620
},
{
"epoch": 0.6994957622572685,
"grad_norm": 115.16569613535562,
"learning_rate": 8.25214592274678e-07,
"logits/chosen": -0.49749755859375,
"logits/rejected": -0.565502941608429,
"logps/chosen": -397.07501220703125,
"logps/rejected": -389.3999938964844,
"loss": 0.5624,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.4298950135707855,
"rewards/margins": 1.4709961414337158,
"rewards/rejected": -1.9002685546875,
"step": 1630
},
{
"epoch": 0.7037871473017917,
"grad_norm": 127.40252022777491,
"learning_rate": 8.241416309012875e-07,
"logits/chosen": -0.5443359613418579,
"logits/rejected": -0.5760253667831421,
"logps/chosen": -359.57501220703125,
"logps/rejected": -360.7124938964844,
"loss": 0.5496,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.5360199213027954,
"rewards/margins": 1.4149658679962158,
"rewards/rejected": -1.950537085533142,
"step": 1640
},
{
"epoch": 0.7080785323463148,
"grad_norm": 60.46521285483948,
"learning_rate": 8.23068669527897e-07,
"logits/chosen": -0.50640869140625,
"logits/rejected": -0.509936511516571,
"logps/chosen": -352.01251220703125,
"logps/rejected": -361.70001220703125,
"loss": 0.4966,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": -0.4793640077114105,
"rewards/margins": 1.878198266029358,
"rewards/rejected": -2.358996629714966,
"step": 1650
},
{
"epoch": 0.7123699173908379,
"grad_norm": 182.34033105607347,
"learning_rate": 8.219957081545064e-07,
"logits/chosen": -0.583239734172821,
"logits/rejected": -0.583789050579071,
"logps/chosen": -404.70001220703125,
"logps/rejected": -401.42498779296875,
"loss": 0.6094,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.755078136920929,
"rewards/margins": 1.395166039466858,
"rewards/rejected": -2.150158643722534,
"step": 1660
},
{
"epoch": 0.716661302435361,
"grad_norm": 104.64828868762461,
"learning_rate": 8.209227467811159e-07,
"logits/chosen": -0.521435558795929,
"logits/rejected": -0.5520263910293579,
"logps/chosen": -370.7250061035156,
"logps/rejected": -359.20001220703125,
"loss": 0.6848,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.4616332948207855,
"rewards/margins": 1.199731469154358,
"rewards/rejected": -1.661767601966858,
"step": 1670
},
{
"epoch": 0.7209526874798842,
"grad_norm": 77.17303575841277,
"learning_rate": 8.198497854077253e-07,
"logits/chosen": -0.46148985624313354,
"logits/rejected": -0.55828857421875,
"logps/chosen": -365.6000061035156,
"logps/rejected": -342.07501220703125,
"loss": 0.6922,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": -0.05918274074792862,
"rewards/margins": 1.3850586414337158,
"rewards/rejected": -1.444067358970642,
"step": 1680
},
{
"epoch": 0.7252440725244073,
"grad_norm": 64.4697217979389,
"learning_rate": 8.187768240343347e-07,
"logits/chosen": -0.42725831270217896,
"logits/rejected": -0.48114013671875,
"logps/chosen": -356.75,
"logps/rejected": -330.01251220703125,
"loss": 0.4518,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": 0.17878417670726776,
"rewards/margins": 1.6595947742462158,
"rewards/rejected": -1.481781005859375,
"step": 1690
},
{
"epoch": 0.7295354575689303,
"grad_norm": 149.1032910167046,
"learning_rate": 8.177038626609442e-07,
"logits/chosen": -0.406646728515625,
"logits/rejected": -0.4510498046875,
"logps/chosen": -356.3500061035156,
"logps/rejected": -367.5249938964844,
"loss": 0.5885,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.11580810695886612,
"rewards/margins": 1.317968726158142,
"rewards/rejected": -1.4335448741912842,
"step": 1700
},
{
"epoch": 0.7338268426134535,
"grad_norm": 102.8164344382787,
"learning_rate": 8.166309012875536e-07,
"logits/chosen": -0.447854608297348,
"logits/rejected": -0.4827026426792145,
"logps/chosen": -363.8999938964844,
"logps/rejected": -340.8999938964844,
"loss": 0.6358,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.10651855170726776,
"rewards/margins": 1.2876708507537842,
"rewards/rejected": -1.394189476966858,
"step": 1710
},
{
"epoch": 0.7381182276579766,
"grad_norm": 153.69365216307173,
"learning_rate": 8.155579399141631e-07,
"logits/chosen": -0.41840821504592896,
"logits/rejected": -0.4554687440395355,
"logps/chosen": -387.3125,
"logps/rejected": -365.875,
"loss": 0.6182,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": -0.20069579780101776,
"rewards/margins": 1.3489501476287842,
"rewards/rejected": -1.5494384765625,
"step": 1720
},
{
"epoch": 0.7424096127024997,
"grad_norm": 76.04781640711542,
"learning_rate": 8.144849785407724e-07,
"logits/chosen": -0.4141906797885895,
"logits/rejected": -0.4426940977573395,
"logps/chosen": -367.42498779296875,
"logps/rejected": -331.04998779296875,
"loss": 0.5223,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": -0.08599853515625,
"rewards/margins": 1.4048278331756592,
"rewards/rejected": -1.4912109375,
"step": 1730
},
{
"epoch": 0.7467009977470228,
"grad_norm": 68.23310240077483,
"learning_rate": 8.13412017167382e-07,
"logits/chosen": -0.46959227323532104,
"logits/rejected": -0.48597413301467896,
"logps/chosen": -374.54998779296875,
"logps/rejected": -384.8999938964844,
"loss": 0.5471,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": -0.08927001804113388,
"rewards/margins": 1.407373070716858,
"rewards/rejected": -1.496606469154358,
"step": 1740
},
{
"epoch": 0.750992382791546,
"grad_norm": 107.96260731375123,
"learning_rate": 8.123390557939915e-07,
"logits/chosen": -0.4058776795864105,
"logits/rejected": -0.45594483613967896,
"logps/chosen": -375.7250061035156,
"logps/rejected": -334.6499938964844,
"loss": 0.6711,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.3480224609375,
"rewards/margins": 1.2222411632537842,
"rewards/rejected": -1.570587158203125,
"step": 1750
},
{
"epoch": 0.7552837678360691,
"grad_norm": 129.23873009661452,
"learning_rate": 8.112660944206008e-07,
"logits/chosen": -0.41258543729782104,
"logits/rejected": -0.407440185546875,
"logps/chosen": -363.3374938964844,
"logps/rejected": -338.7749938964844,
"loss": 0.55,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.14633789658546448,
"rewards/margins": 1.4525146484375,
"rewards/rejected": -1.598779320716858,
"step": 1760
},
{
"epoch": 0.7595751528805922,
"grad_norm": 48.144126354391204,
"learning_rate": 8.101931330472103e-07,
"logits/chosen": -0.361968994140625,
"logits/rejected": -0.3884033262729645,
"logps/chosen": -338.45001220703125,
"logps/rejected": -314.1000061035156,
"loss": 0.6883,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.23784179985523224,
"rewards/margins": 1.268212914466858,
"rewards/rejected": -1.0308105945587158,
"step": 1770
},
{
"epoch": 0.7638665379251154,
"grad_norm": 95.56446959520261,
"learning_rate": 8.091201716738197e-07,
"logits/chosen": -0.31524658203125,
"logits/rejected": -0.340383917093277,
"logps/chosen": -319.8500061035156,
"logps/rejected": -321.0,
"loss": 0.5326,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.3859619200229645,
"rewards/margins": 1.397973656654358,
"rewards/rejected": -1.0114624500274658,
"step": 1780
},
{
"epoch": 0.7681579229696385,
"grad_norm": 103.09494934406682,
"learning_rate": 8.080472103004291e-07,
"logits/chosen": -0.4416259825229645,
"logits/rejected": -0.47047120332717896,
"logps/chosen": -357.9750061035156,
"logps/rejected": -350.92498779296875,
"loss": 0.6076,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": -0.05386962741613388,
"rewards/margins": 1.2465698719024658,
"rewards/rejected": -1.300622582435608,
"step": 1790
},
{
"epoch": 0.7724493080141616,
"grad_norm": 145.80884265242486,
"learning_rate": 8.069742489270386e-07,
"logits/chosen": -0.42521363496780396,
"logits/rejected": -0.4398437440395355,
"logps/chosen": -377.8500061035156,
"logps/rejected": -367.67498779296875,
"loss": 0.5738,
"rewards/accuracies": 0.737500011920929,
"rewards/chosen": -0.4979003965854645,
"rewards/margins": 1.4534118175506592,
"rewards/rejected": -1.952612280845642,
"step": 1800
},
{
"epoch": 0.7767406930586847,
"grad_norm": 101.16487539387255,
"learning_rate": 8.05901287553648e-07,
"logits/chosen": -0.49574583768844604,
"logits/rejected": -0.5306152105331421,
"logps/chosen": -385.5249938964844,
"logps/rejected": -367.57501220703125,
"loss": 0.5431,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.5192779302597046,
"rewards/margins": 1.4374268054962158,
"rewards/rejected": -1.9562499523162842,
"step": 1810
},
{
"epoch": 0.7810320781032078,
"grad_norm": 84.4411142242806,
"learning_rate": 8.048283261802575e-07,
"logits/chosen": -0.4796142578125,
"logits/rejected": -0.508770763874054,
"logps/chosen": -365.86248779296875,
"logps/rejected": -356.3500061035156,
"loss": 0.6657,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.883410632610321,
"rewards/margins": 1.223120093345642,
"rewards/rejected": -2.1060791015625,
"step": 1820
},
{
"epoch": 0.7853234631477309,
"grad_norm": 115.57764002933129,
"learning_rate": 8.037553648068669e-07,
"logits/chosen": -0.546875,
"logits/rejected": -0.5829498171806335,
"logps/chosen": -359.7250061035156,
"logps/rejected": -337.57501220703125,
"loss": 0.7296,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -1.026031494140625,
"rewards/margins": 0.8546386957168579,
"rewards/rejected": -1.880517601966858,
"step": 1830
},
{
"epoch": 0.789614848192254,
"grad_norm": 103.0460534756151,
"learning_rate": 8.026824034334764e-07,
"logits/chosen": -0.5229126214981079,
"logits/rejected": -0.5728759765625,
"logps/chosen": -403.4750061035156,
"logps/rejected": -356.04998779296875,
"loss": 0.6826,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.888287365436554,
"rewards/margins": 0.9383544921875,
"rewards/rejected": -1.827490210533142,
"step": 1840
},
{
"epoch": 0.7939062332367771,
"grad_norm": 58.14013738451265,
"learning_rate": 8.016094420600859e-07,
"logits/chosen": -0.4228149354457855,
"logits/rejected": -0.47142332792282104,
"logps/chosen": -379.82501220703125,
"logps/rejected": -374.45001220703125,
"loss": 0.5898,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.415771484375,
"rewards/margins": 1.040673851966858,
"rewards/rejected": -1.455438256263733,
"step": 1850
},
{
"epoch": 0.7981976182813003,
"grad_norm": 64.72324046460037,
"learning_rate": 8.005364806866952e-07,
"logits/chosen": -0.48001402616500854,
"logits/rejected": -0.5206695795059204,
"logps/chosen": -355.51251220703125,
"logps/rejected": -329.92498779296875,
"loss": 0.5486,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.14082030951976776,
"rewards/margins": 1.267333984375,
"rewards/rejected": -1.126745581626892,
"step": 1860
},
{
"epoch": 0.8024890033258234,
"grad_norm": 92.66296531949637,
"learning_rate": 7.994635193133047e-07,
"logits/chosen": -0.4834960997104645,
"logits/rejected": -0.52276611328125,
"logps/chosen": -346.875,
"logps/rejected": -360.1000061035156,
"loss": 0.6322,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -0.29844969511032104,
"rewards/margins": 1.1924560070037842,
"rewards/rejected": -1.491418480873108,
"step": 1870
},
{
"epoch": 0.8067803883703465,
"grad_norm": 155.25372862771923,
"learning_rate": 7.983905579399141e-07,
"logits/chosen": -0.48237305879592896,
"logits/rejected": -0.513842761516571,
"logps/chosen": -398.125,
"logps/rejected": -375.82501220703125,
"loss": 0.6616,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -0.661267101764679,
"rewards/margins": 1.28704833984375,
"rewards/rejected": -1.948278784751892,
"step": 1880
},
{
"epoch": 0.8110717734148697,
"grad_norm": 96.48468679812369,
"learning_rate": 7.973175965665235e-07,
"logits/chosen": -0.5263671875,
"logits/rejected": -0.551501452922821,
"logps/chosen": -352.61248779296875,
"logps/rejected": -361.2749938964844,
"loss": 0.5677,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.6576477289199829,
"rewards/margins": 1.3949706554412842,
"rewards/rejected": -2.052685499191284,
"step": 1890
},
{
"epoch": 0.8153631584593928,
"grad_norm": 117.26416137288112,
"learning_rate": 7.96244635193133e-07,
"logits/chosen": -0.4586242735385895,
"logits/rejected": -0.4781738221645355,
"logps/chosen": -352.3500061035156,
"logps/rejected": -356.07501220703125,
"loss": 0.5319,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": -0.47181397676467896,
"rewards/margins": 1.3197510242462158,
"rewards/rejected": -1.7908935546875,
"step": 1900
},
{
"epoch": 0.8196545435039159,
"grad_norm": 75.35991358014043,
"learning_rate": 7.951716738197425e-07,
"logits/chosen": -0.5106903314590454,
"logits/rejected": -0.535693347454071,
"logps/chosen": -395.38751220703125,
"logps/rejected": -396.625,
"loss": 0.5579,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": -0.4886108338832855,
"rewards/margins": 1.457763671875,
"rewards/rejected": -1.94580078125,
"step": 1910
},
{
"epoch": 0.823945928548439,
"grad_norm": 87.36390962579817,
"learning_rate": 7.940987124463519e-07,
"logits/chosen": -0.43651121854782104,
"logits/rejected": -0.463156133890152,
"logps/chosen": -334.88751220703125,
"logps/rejected": -323.82501220703125,
"loss": 0.6742,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": -0.5482543706893921,
"rewards/margins": 0.8956054449081421,
"rewards/rejected": -1.4434630870819092,
"step": 1920
},
{
"epoch": 0.8282373135929622,
"grad_norm": 69.40186273752217,
"learning_rate": 7.930257510729613e-07,
"logits/chosen": -0.4944824278354645,
"logits/rejected": -0.5515899658203125,
"logps/chosen": -351.7250061035156,
"logps/rejected": -350.42498779296875,
"loss": 0.4568,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": -0.10759429633617401,
"rewards/margins": 1.702294945716858,
"rewards/rejected": -1.808691382408142,
"step": 1930
},
{
"epoch": 0.8325286986374852,
"grad_norm": 104.89991735780596,
"learning_rate": 7.919527896995708e-07,
"logits/chosen": -0.418426513671875,
"logits/rejected": -0.44764405488967896,
"logps/chosen": -341.04998779296875,
"logps/rejected": -335.6499938964844,
"loss": 0.5415,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.15447387099266052,
"rewards/margins": 1.450292944908142,
"rewards/rejected": -1.604248046875,
"step": 1940
},
{
"epoch": 0.8368200836820083,
"grad_norm": 82.68903649771558,
"learning_rate": 7.908798283261803e-07,
"logits/chosen": -0.4495605528354645,
"logits/rejected": -0.510424792766571,
"logps/chosen": -373.3374938964844,
"logps/rejected": -364.67498779296875,
"loss": 0.5789,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.779125988483429,
"rewards/margins": 1.6708984375,
"rewards/rejected": -2.449951171875,
"step": 1950
},
{
"epoch": 0.8411114687265315,
"grad_norm": 86.21352102169897,
"learning_rate": 7.898068669527896e-07,
"logits/chosen": -0.46674805879592896,
"logits/rejected": -0.528363049030304,
"logps/chosen": -367.42498779296875,
"logps/rejected": -361.70001220703125,
"loss": 0.6793,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.8564208745956421,
"rewards/margins": 1.278417944908142,
"rewards/rejected": -2.133984327316284,
"step": 1960
},
{
"epoch": 0.8454028537710546,
"grad_norm": 54.69051017258,
"learning_rate": 7.887339055793991e-07,
"logits/chosen": -0.4278625547885895,
"logits/rejected": -0.43818360567092896,
"logps/chosen": -364.5249938964844,
"logps/rejected": -342.13751220703125,
"loss": 0.6952,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.8060302734375,
"rewards/margins": 1.024389624595642,
"rewards/rejected": -1.830468773841858,
"step": 1970
},
{
"epoch": 0.8496942388155777,
"grad_norm": 148.37339661044908,
"learning_rate": 7.876609442060086e-07,
"logits/chosen": -0.4754638671875,
"logits/rejected": -0.551074206829071,
"logps/chosen": -358.0,
"logps/rejected": -356.6499938964844,
"loss": 0.6452,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.5104004144668579,
"rewards/margins": 1.115087866783142,
"rewards/rejected": -1.6243164539337158,
"step": 1980
},
{
"epoch": 0.8539856238601008,
"grad_norm": 116.66459040759774,
"learning_rate": 7.86587982832618e-07,
"logits/chosen": -0.4542480409145355,
"logits/rejected": -0.5120605230331421,
"logps/chosen": -351.17498779296875,
"logps/rejected": -348.70001220703125,
"loss": 0.5138,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": -0.41557615995407104,
"rewards/margins": 1.316796898841858,
"rewards/rejected": -1.7315795421600342,
"step": 1990
},
{
"epoch": 0.858277008904624,
"grad_norm": 74.51727230697634,
"learning_rate": 7.855150214592274e-07,
"logits/chosen": -0.5084472894668579,
"logits/rejected": -0.5223144292831421,
"logps/chosen": -350.5375061035156,
"logps/rejected": -353.45001220703125,
"loss": 0.6133,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.742321789264679,
"rewards/margins": 1.1166503429412842,
"rewards/rejected": -1.8595459461212158,
"step": 2000
},
{
"epoch": 0.8625683939491471,
"grad_norm": 76.42518524272083,
"learning_rate": 7.844420600858369e-07,
"logits/chosen": -0.40562134981155396,
"logits/rejected": -0.4638671875,
"logps/chosen": -378.8500061035156,
"logps/rejected": -348.5249938964844,
"loss": 0.5948,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": -0.3991332948207855,
"rewards/margins": 1.241552710533142,
"rewards/rejected": -1.6391723155975342,
"step": 2010
},
{
"epoch": 0.8668597789936702,
"grad_norm": 54.51765241834094,
"learning_rate": 7.833690987124463e-07,
"logits/chosen": -0.4284210205078125,
"logits/rejected": -0.4304443299770355,
"logps/chosen": -362.2749938964844,
"logps/rejected": -367.2749938964844,
"loss": 0.5515,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.05325622484087944,
"rewards/margins": 1.4757080078125,
"rewards/rejected": -1.5295226573944092,
"step": 2020
},
{
"epoch": 0.8711511640381934,
"grad_norm": 138.1342111756548,
"learning_rate": 7.822961373390557e-07,
"logits/chosen": -0.40978699922561646,
"logits/rejected": -0.4723144471645355,
"logps/chosen": -319.73748779296875,
"logps/rejected": -332.95001220703125,
"loss": 0.6562,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.10593261569738388,
"rewards/margins": 1.3680419921875,
"rewards/rejected": -1.4743163585662842,
"step": 2030
},
{
"epoch": 0.8754425490827165,
"grad_norm": 91.78491639079485,
"learning_rate": 7.812231759656652e-07,
"logits/chosen": -0.4817871153354645,
"logits/rejected": -0.528088390827179,
"logps/chosen": -396.75,
"logps/rejected": -370.88751220703125,
"loss": 0.5513,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0025268555618822575,
"rewards/margins": 1.516137719154358,
"rewards/rejected": -1.5186767578125,
"step": 2040
},
{
"epoch": 0.8797339341272395,
"grad_norm": 77.17492445581468,
"learning_rate": 7.801502145922745e-07,
"logits/chosen": -0.4148010313510895,
"logits/rejected": -0.4875854551792145,
"logps/chosen": -358.92498779296875,
"logps/rejected": -361.42498779296875,
"loss": 0.6086,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.23957519233226776,
"rewards/margins": 1.202734351158142,
"rewards/rejected": -1.441613793373108,
"step": 2050
},
{
"epoch": 0.8840253191717626,
"grad_norm": 135.0296706180856,
"learning_rate": 7.790772532188841e-07,
"logits/chosen": -0.47888487577438354,
"logits/rejected": -0.521099865436554,
"logps/chosen": -373.7749938964844,
"logps/rejected": -352.8500061035156,
"loss": 0.6476,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.2934204041957855,
"rewards/margins": 1.2010009288787842,
"rewards/rejected": -1.494726538658142,
"step": 2060
},
{
"epoch": 0.8883167042162858,
"grad_norm": 108.33533325666654,
"learning_rate": 7.780042918454936e-07,
"logits/chosen": -0.44842529296875,
"logits/rejected": -0.4959869384765625,
"logps/chosen": -334.82501220703125,
"logps/rejected": -344.9750061035156,
"loss": 0.5891,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.3254150450229645,
"rewards/margins": 1.216406226158142,
"rewards/rejected": -1.539819359779358,
"step": 2070
},
{
"epoch": 0.8926080892608089,
"grad_norm": 119.50061579026615,
"learning_rate": 7.76931330472103e-07,
"logits/chosen": -0.4915771484375,
"logits/rejected": -0.5180877447128296,
"logps/chosen": -416.32501220703125,
"logps/rejected": -357.8500061035156,
"loss": 0.7027,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.12856444716453552,
"rewards/margins": 0.9456542730331421,
"rewards/rejected": -1.075097680091858,
"step": 2080
},
{
"epoch": 0.896899474305332,
"grad_norm": 94.56096315743068,
"learning_rate": 7.758583690987124e-07,
"logits/chosen": -0.41645509004592896,
"logits/rejected": -0.44414061307907104,
"logps/chosen": -364.8500061035156,
"logps/rejected": -338.7749938964844,
"loss": 0.608,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": 0.17025145888328552,
"rewards/margins": 1.036157250404358,
"rewards/rejected": -0.8646789789199829,
"step": 2090
},
{
"epoch": 0.9011908593498552,
"grad_norm": 127.52232658232568,
"learning_rate": 7.747854077253218e-07,
"logits/chosen": -0.49885255098342896,
"logits/rejected": -0.5464843511581421,
"logps/chosen": -360.8125,
"logps/rejected": -368.57501220703125,
"loss": 0.6526,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.13181762397289276,
"rewards/margins": 1.148290991783142,
"rewards/rejected": -1.015893578529358,
"step": 2100
},
{
"epoch": 0.9054822443943783,
"grad_norm": 92.20078512328853,
"learning_rate": 7.737124463519313e-07,
"logits/chosen": -0.5203918218612671,
"logits/rejected": -0.545550525188446,
"logps/chosen": -364.67498779296875,
"logps/rejected": -353.82501220703125,
"loss": 0.6857,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.07219238579273224,
"rewards/margins": 0.6644226312637329,
"rewards/rejected": -0.591845691204071,
"step": 2110
},
{
"epoch": 0.9097736294389014,
"grad_norm": 61.334335744281304,
"learning_rate": 7.726394849785407e-07,
"logits/chosen": -0.48918455839157104,
"logits/rejected": -0.563916027545929,
"logps/chosen": -366.875,
"logps/rejected": -357.4750061035156,
"loss": 0.5989,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -0.024749755859375,
"rewards/margins": 1.312280297279358,
"rewards/rejected": -1.3367919921875,
"step": 2120
},
{
"epoch": 0.9140650144834245,
"grad_norm": 79.2160070511654,
"learning_rate": 7.715665236051501e-07,
"logits/chosen": -0.4615112245082855,
"logits/rejected": -0.516741931438446,
"logps/chosen": -358.8374938964844,
"logps/rejected": -371.32501220703125,
"loss": 0.5299,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": -0.07028808444738388,
"rewards/margins": 1.395654320716858,
"rewards/rejected": -1.4654541015625,
"step": 2130
},
{
"epoch": 0.9183563995279477,
"grad_norm": 99.46895603219903,
"learning_rate": 7.704935622317597e-07,
"logits/chosen": -0.44951170682907104,
"logits/rejected": -0.49359130859375,
"logps/chosen": -306.76873779296875,
"logps/rejected": -319.4375,
"loss": 0.6028,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": -0.11284790188074112,
"rewards/margins": 1.2532470226287842,
"rewards/rejected": -1.364446997642517,
"step": 2140
},
{
"epoch": 0.9226477845724708,
"grad_norm": 101.25106091610708,
"learning_rate": 7.69420600858369e-07,
"logits/chosen": -0.5082947015762329,
"logits/rejected": -0.5229736566543579,
"logps/chosen": -396.375,
"logps/rejected": -371.2749938964844,
"loss": 0.6378,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.20824280381202698,
"rewards/margins": 1.2848389148712158,
"rewards/rejected": -1.4934203624725342,
"step": 2150
},
{
"epoch": 0.9269391696169939,
"grad_norm": 79.54297809921317,
"learning_rate": 7.683476394849785e-07,
"logits/chosen": -0.4613037109375,
"logits/rejected": -0.4837402403354645,
"logps/chosen": -338.20001220703125,
"logps/rejected": -326.7749938964844,
"loss": 0.6613,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": 0.09599609673023224,
"rewards/margins": 1.33660888671875,
"rewards/rejected": -1.240136742591858,
"step": 2160
},
{
"epoch": 0.931230554661517,
"grad_norm": 59.944492669875906,
"learning_rate": 7.67274678111588e-07,
"logits/chosen": -0.47618407011032104,
"logits/rejected": -0.518261730670929,
"logps/chosen": -356.1875,
"logps/rejected": -334.70001220703125,
"loss": 0.6136,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.14970092475414276,
"rewards/margins": 1.50927734375,
"rewards/rejected": -1.359765648841858,
"step": 2170
},
{
"epoch": 0.9355219397060401,
"grad_norm": 115.99307866573162,
"learning_rate": 7.662017167381974e-07,
"logits/chosen": -0.5174560546875,
"logits/rejected": -0.568493664264679,
"logps/chosen": -359.6000061035156,
"logps/rejected": -344.51251220703125,
"loss": 0.59,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.625903308391571,
"rewards/margins": 1.3516113758087158,
"rewards/rejected": -0.726550281047821,
"step": 2180
},
{
"epoch": 0.9398133247505632,
"grad_norm": 93.0545576745169,
"learning_rate": 7.651287553648068e-07,
"logits/chosen": -0.4970703125,
"logits/rejected": -0.572436511516571,
"logps/chosen": -389.3500061035156,
"logps/rejected": -326.7250061035156,
"loss": 0.5889,
"rewards/accuracies": 0.762499988079071,
"rewards/chosen": 0.589404284954071,
"rewards/margins": 1.3962280750274658,
"rewards/rejected": -0.80706787109375,
"step": 2190
},
{
"epoch": 0.9441047097950863,
"grad_norm": 112.3176831541809,
"learning_rate": 7.640557939914162e-07,
"logits/chosen": -0.469583123922348,
"logits/rejected": -0.4869018495082855,
"logps/chosen": -389.61248779296875,
"logps/rejected": -341.45001220703125,
"loss": 0.5473,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.7899566888809204,
"rewards/margins": 1.5120117664337158,
"rewards/rejected": -0.7217773199081421,
"step": 2200
},
{
"epoch": 0.9483960948396095,
"grad_norm": 69.84713721388559,
"learning_rate": 7.629828326180258e-07,
"logits/chosen": -0.504223644733429,
"logits/rejected": -0.5489257574081421,
"logps/chosen": -337.61248779296875,
"logps/rejected": -321.5249938964844,
"loss": 0.4556,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": 0.3408203125,
"rewards/margins": 1.6074097156524658,
"rewards/rejected": -1.266626000404358,
"step": 2210
},
{
"epoch": 0.9526874798841326,
"grad_norm": 92.65696311334176,
"learning_rate": 7.619098712446352e-07,
"logits/chosen": -0.46807557344436646,
"logits/rejected": -0.566113293170929,
"logps/chosen": -371.13751220703125,
"logps/rejected": -353.70001220703125,
"loss": 0.5619,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": -0.577130138874054,
"rewards/margins": 1.8107421398162842,
"rewards/rejected": -2.3877930641174316,
"step": 2220
},
{
"epoch": 0.9569788649286557,
"grad_norm": 113.47943811133267,
"learning_rate": 7.608369098712446e-07,
"logits/chosen": -0.4912170469760895,
"logits/rejected": -0.5322510004043579,
"logps/chosen": -370.5,
"logps/rejected": -378.20001220703125,
"loss": 0.5809,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": -0.962756335735321,
"rewards/margins": 1.6916015148162842,
"rewards/rejected": -2.654296875,
"step": 2230
},
{
"epoch": 0.9612702499731789,
"grad_norm": 80.58967592092004,
"learning_rate": 7.597639484978541e-07,
"logits/chosen": -0.3969230651855469,
"logits/rejected": -0.4379516541957855,
"logps/chosen": -355.4624938964844,
"logps/rejected": -356.5,
"loss": 0.5291,
"rewards/accuracies": 0.7437499761581421,
"rewards/chosen": -0.7849975824356079,
"rewards/margins": 1.7169921398162842,
"rewards/rejected": -2.504565477371216,
"step": 2240
},
{
"epoch": 0.965561635017702,
"grad_norm": 97.03344726050717,
"learning_rate": 7.586909871244634e-07,
"logits/chosen": -0.5103515386581421,
"logits/rejected": -0.5685790777206421,
"logps/chosen": -361.4750061035156,
"logps/rejected": -376.1499938964844,
"loss": 0.5653,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": -0.8719482421875,
"rewards/margins": 1.3838989734649658,
"rewards/rejected": -2.2578492164611816,
"step": 2250
},
{
"epoch": 0.9698530200622251,
"grad_norm": 88.956038779029,
"learning_rate": 7.576180257510729e-07,
"logits/chosen": -0.48927003145217896,
"logits/rejected": -0.5119994878768921,
"logps/chosen": -346.35626220703125,
"logps/rejected": -337.32501220703125,
"loss": 0.7,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": -0.8078247308731079,
"rewards/margins": 1.037023901939392,
"rewards/rejected": -1.846215844154358,
"step": 2260
},
{
"epoch": 0.9741444051067482,
"grad_norm": 124.32061280539118,
"learning_rate": 7.565450643776824e-07,
"logits/chosen": -0.46381837129592896,
"logits/rejected": -0.511340320110321,
"logps/chosen": -397.375,
"logps/rejected": -395.95001220703125,
"loss": 0.6108,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.768206775188446,
"rewards/margins": 1.4190185070037842,
"rewards/rejected": -2.1888184547424316,
"step": 2270
},
{
"epoch": 0.9784357901512714,
"grad_norm": 100.19724839414987,
"learning_rate": 7.554721030042917e-07,
"logits/chosen": -0.518725574016571,
"logits/rejected": -0.5394287109375,
"logps/chosen": -377.625,
"logps/rejected": -361.1625061035156,
"loss": 0.5221,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.678759753704071,
"rewards/margins": 1.383544921875,
"rewards/rejected": -2.0615234375,
"step": 2280
},
{
"epoch": 0.9827271751957944,
"grad_norm": 69.13476580861254,
"learning_rate": 7.543991416309013e-07,
"logits/chosen": -0.46104735136032104,
"logits/rejected": -0.5124450922012329,
"logps/chosen": -357.625,
"logps/rejected": -345.4125061035156,
"loss": 0.6403,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": -0.6890014410018921,
"rewards/margins": 1.289648413658142,
"rewards/rejected": -1.977746605873108,
"step": 2290
},
{
"epoch": 0.9870185602403175,
"grad_norm": 130.45723858358505,
"learning_rate": 7.533261802575107e-07,
"logits/chosen": -0.530078113079071,
"logits/rejected": -0.5547851324081421,
"logps/chosen": -397.5,
"logps/rejected": -366.70001220703125,
"loss": 0.576,
"rewards/accuracies": 0.7437499761581421,
"rewards/chosen": -0.22761230170726776,
"rewards/margins": 1.387853980064392,
"rewards/rejected": -1.6165587902069092,
"step": 2300
},
{
"epoch": 0.9913099452848407,
"grad_norm": 99.00884454952215,
"learning_rate": 7.522532188841202e-07,
"logits/chosen": -0.5212036371231079,
"logits/rejected": -0.5637451410293579,
"logps/chosen": -342.1499938964844,
"logps/rejected": -327.17498779296875,
"loss": 0.5438,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": -0.2813476622104645,
"rewards/margins": 1.3585937023162842,
"rewards/rejected": -1.6410033702850342,
"step": 2310
},
{
"epoch": 0.9956013303293638,
"grad_norm": 128.79776121372566,
"learning_rate": 7.511802575107296e-07,
"logits/chosen": -0.5853271484375,
"logits/rejected": -0.5942627191543579,
"logps/chosen": -374.32501220703125,
"logps/rejected": -333.9750061035156,
"loss": 0.5645,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.25792235136032104,
"rewards/margins": 1.2442138195037842,
"rewards/rejected": -1.5037353038787842,
"step": 2320
},
{
"epoch": 0.9998927153738869,
"grad_norm": 91.00148901713771,
"learning_rate": 7.50107296137339e-07,
"logits/chosen": -0.536328136920929,
"logits/rejected": -0.5860840082168579,
"logps/chosen": -390.6000061035156,
"logps/rejected": -365.29998779296875,
"loss": 0.6829,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.3775573670864105,
"rewards/margins": 1.2346923351287842,
"rewards/rejected": -1.6121337413787842,
"step": 2330
},
{
"epoch": 1.0038622465400708,
"grad_norm": 4.621264339534561,
"learning_rate": 7.490343347639485e-07,
"logits/chosen": -0.48371514678001404,
"logits/rejected": -0.5052523016929626,
"logps/chosen": -355.5,
"logps/rejected": -418.7837829589844,
"loss": 0.0335,
"rewards/accuracies": 0.9864864945411682,
"rewards/chosen": 2.5475611686706543,
"rewards/margins": 7.206925868988037,
"rewards/rejected": -4.657094478607178,
"step": 2340
},
{
"epoch": 1.008153631584594,
"grad_norm": 0.9073196202676276,
"learning_rate": 7.479613733905578e-07,
"logits/chosen": -0.5647217035293579,
"logits/rejected": -0.612353503704071,
"logps/chosen": -368.5,
"logps/rejected": -420.5,
"loss": 0.0346,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": 1.9235718250274658,
"rewards/margins": 7.966796875,
"rewards/rejected": -6.041406154632568,
"step": 2350
},
{
"epoch": 1.012445016629117,
"grad_norm": 1.0015719207867788,
"learning_rate": 7.468884120171673e-07,
"logits/chosen": -0.5823119878768921,
"logits/rejected": -0.608288586139679,
"logps/chosen": -339.4624938964844,
"logps/rejected": -381.1499938964844,
"loss": 0.0433,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 2.1738572120666504,
"rewards/margins": 8.417187690734863,
"rewards/rejected": -6.245312690734863,
"step": 2360
},
{
"epoch": 1.0167364016736402,
"grad_norm": 13.85385602579631,
"learning_rate": 7.458154506437769e-07,
"logits/chosen": -0.668505847454071,
"logits/rejected": -0.6723388433456421,
"logps/chosen": -391.6499938964844,
"logps/rejected": -438.3999938964844,
"loss": 0.0606,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 1.41058349609375,
"rewards/margins": 8.915234565734863,
"rewards/rejected": -7.505859375,
"step": 2370
},
{
"epoch": 1.0210277867181632,
"grad_norm": 5.570589963103772,
"learning_rate": 7.447424892703862e-07,
"logits/chosen": -0.655468761920929,
"logits/rejected": -0.694384753704071,
"logps/chosen": -377.4750061035156,
"logps/rejected": -426.3500061035156,
"loss": 0.0413,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 1.406591773033142,
"rewards/margins": 9.630468368530273,
"rewards/rejected": -8.219141006469727,
"step": 2380
},
{
"epoch": 1.0253191717626864,
"grad_norm": 9.930833208056239,
"learning_rate": 7.436695278969957e-07,
"logits/chosen": -0.7109375,
"logits/rejected": -0.726855456829071,
"logps/chosen": -364.1000061035156,
"logps/rejected": -416.32501220703125,
"loss": 0.0589,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": 0.509033203125,
"rewards/margins": 9.190625190734863,
"rewards/rejected": -8.672656059265137,
"step": 2390
},
{
"epoch": 1.0296105568072096,
"grad_norm": 41.13654226096193,
"learning_rate": 7.425965665236051e-07,
"logits/chosen": -0.733203113079071,
"logits/rejected": -0.800097644329071,
"logps/chosen": -365.1499938964844,
"logps/rejected": -417.95001220703125,
"loss": 0.075,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 0.7457641363143921,
"rewards/margins": 8.888671875,
"rewards/rejected": -8.137890815734863,
"step": 2400
},
{
"epoch": 1.0339019418517326,
"grad_norm": 1.104155581549493,
"learning_rate": 7.415236051502145e-07,
"logits/chosen": -0.6716552972793579,
"logits/rejected": -0.704174816608429,
"logps/chosen": -339.875,
"logps/rejected": -439.4624938964844,
"loss": 0.0258,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": 1.308508276939392,
"rewards/margins": 9.708984375,
"rewards/rejected": -8.400390625,
"step": 2410
},
{
"epoch": 1.0381933268962558,
"grad_norm": 26.46691059125149,
"learning_rate": 7.40450643776824e-07,
"logits/chosen": -0.76165771484375,
"logits/rejected": -0.8182128667831421,
"logps/chosen": -372.82501220703125,
"logps/rejected": -425.5249938964844,
"loss": 0.048,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 0.5227111577987671,
"rewards/margins": 9.0546875,
"rewards/rejected": -8.536718368530273,
"step": 2420
},
{
"epoch": 1.042484711940779,
"grad_norm": 3.660143258678806,
"learning_rate": 7.393776824034334e-07,
"logits/chosen": -0.663159191608429,
"logits/rejected": -0.6626983880996704,
"logps/chosen": -371.0375061035156,
"logps/rejected": -435.79998779296875,
"loss": 0.0334,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": 0.49080199003219604,
"rewards/margins": 9.974218368530273,
"rewards/rejected": -9.483593940734863,
"step": 2430
},
{
"epoch": 1.046776096985302,
"grad_norm": 16.94590830302066,
"learning_rate": 7.38304721030043e-07,
"logits/chosen": -0.7198852300643921,
"logits/rejected": -0.743847668170929,
"logps/chosen": -380.01251220703125,
"logps/rejected": -457.1499938964844,
"loss": 0.0944,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.004931640811264515,
"rewards/margins": 10.082812309265137,
"rewards/rejected": -10.091405868530273,
"step": 2440
},
{
"epoch": 1.0510674820298251,
"grad_norm": 3.835280816722687,
"learning_rate": 7.372317596566523e-07,
"logits/chosen": -0.703417956829071,
"logits/rejected": -0.734082043170929,
"logps/chosen": -337.1625061035156,
"logps/rejected": -419.5,
"loss": 0.0361,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 0.538134753704071,
"rewards/margins": 9.961718559265137,
"rewards/rejected": -9.419530868530273,
"step": 2450
},
{
"epoch": 1.0553588670743483,
"grad_norm": 10.659711615249932,
"learning_rate": 7.361587982832618e-07,
"logits/chosen": -0.7720702886581421,
"logits/rejected": -0.8095947504043579,
"logps/chosen": -367.1000061035156,
"logps/rejected": -464.45001220703125,
"loss": 0.0267,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.0674927234649658,
"rewards/margins": 11.157031059265137,
"rewards/rejected": -12.225781440734863,
"step": 2460
},
{
"epoch": 1.0596502521188713,
"grad_norm": 56.6233849490534,
"learning_rate": 7.350858369098713e-07,
"logits/chosen": -0.8584960699081421,
"logits/rejected": -0.881787121295929,
"logps/chosen": -401.8999938964844,
"logps/rejected": -454.8500061035156,
"loss": 0.0473,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.2240722179412842,
"rewards/margins": 10.826562881469727,
"rewards/rejected": -12.045312881469727,
"step": 2470
},
{
"epoch": 1.0639416371633945,
"grad_norm": 2.250184231795305,
"learning_rate": 7.340128755364806e-07,
"logits/chosen": -0.8057616949081421,
"logits/rejected": -0.811328113079071,
"logps/chosen": -404.04998779296875,
"logps/rejected": -483.6499938964844,
"loss": 0.0411,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.6454101800918579,
"rewards/margins": 10.669921875,
"rewards/rejected": -11.316015243530273,
"step": 2480
},
{
"epoch": 1.0682330222079175,
"grad_norm": 32.256317713873734,
"learning_rate": 7.329399141630901e-07,
"logits/chosen": -0.677734375,
"logits/rejected": -0.6978210210800171,
"logps/chosen": -384.125,
"logps/rejected": -435.79998779296875,
"loss": 0.0614,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.56732177734375,
"rewards/margins": 10.059374809265137,
"rewards/rejected": -10.625391006469727,
"step": 2490
},
{
"epoch": 1.0725244072524407,
"grad_norm": 14.208372299625701,
"learning_rate": 7.318669527896995e-07,
"logits/chosen": -0.7776855230331421,
"logits/rejected": -0.8174804449081421,
"logps/chosen": -392.67498779296875,
"logps/rejected": -452.82501220703125,
"loss": 0.0166,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -0.559033215045929,
"rewards/margins": 10.008593559265137,
"rewards/rejected": -10.560155868530273,
"step": 2500
},
{
"epoch": 1.076815792296964,
"grad_norm": 56.13443787511979,
"learning_rate": 7.307939914163089e-07,
"logits/chosen": -0.7345947027206421,
"logits/rejected": -0.7589111328125,
"logps/chosen": -356.2749938964844,
"logps/rejected": -463.375,
"loss": 0.0297,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -0.47059327363967896,
"rewards/margins": 11.346094131469727,
"rewards/rejected": -11.814844131469727,
"step": 2510
},
{
"epoch": 1.0811071773414869,
"grad_norm": 0.7670041871093395,
"learning_rate": 7.297210300429184e-07,
"logits/chosen": -0.759960949420929,
"logits/rejected": -0.7905517816543579,
"logps/chosen": -404.04998779296875,
"logps/rejected": -461.25,
"loss": 0.0157,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.09202270209789276,
"rewards/margins": 10.5234375,
"rewards/rejected": -10.622655868530273,
"step": 2520
},
{
"epoch": 1.08539856238601,
"grad_norm": 32.136216847856105,
"learning_rate": 7.286480686695279e-07,
"logits/chosen": -0.83544921875,
"logits/rejected": -0.8470703363418579,
"logps/chosen": -391.5874938964844,
"logps/rejected": -446.0,
"loss": 0.0428,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.1182861328125,
"rewards/margins": 9.594531059265137,
"rewards/rejected": -9.71484375,
"step": 2530
},
{
"epoch": 1.0896899474305333,
"grad_norm": 24.666337072380923,
"learning_rate": 7.275751072961374e-07,
"logits/chosen": -0.6993652582168579,
"logits/rejected": -0.7181152105331421,
"logps/chosen": -401.79998779296875,
"logps/rejected": -431.79998779296875,
"loss": 0.0965,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -0.25605469942092896,
"rewards/margins": 9.896875381469727,
"rewards/rejected": -10.151562690734863,
"step": 2540
},
{
"epoch": 1.0939813324750562,
"grad_norm": 34.22705197223228,
"learning_rate": 7.265021459227467e-07,
"logits/chosen": -0.7691650390625,
"logits/rejected": -0.7947998046875,
"logps/chosen": -367.95001220703125,
"logps/rejected": -439.1499938964844,
"loss": 0.0501,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.16741943359375,
"rewards/margins": 9.961718559265137,
"rewards/rejected": -9.801562309265137,
"step": 2550
},
{
"epoch": 1.0982727175195794,
"grad_norm": 0.9318919309568936,
"learning_rate": 7.254291845493562e-07,
"logits/chosen": -0.7223876714706421,
"logits/rejected": -0.7237182855606079,
"logps/chosen": -371.9125061035156,
"logps/rejected": -426.875,
"loss": 0.0725,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.3539977967739105,
"rewards/margins": 9.237109184265137,
"rewards/rejected": -9.59375,
"step": 2560
},
{
"epoch": 1.1025641025641026,
"grad_norm": 13.10894288906175,
"learning_rate": 7.243562231759657e-07,
"logits/chosen": -0.753588855266571,
"logits/rejected": -0.758007824420929,
"logps/chosen": -381.2250061035156,
"logps/rejected": -431.54998779296875,
"loss": 0.0484,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": 0.561230480670929,
"rewards/margins": 9.284375190734863,
"rewards/rejected": -8.720703125,
"step": 2570
},
{
"epoch": 1.1068554876086256,
"grad_norm": 2.7797157178374077,
"learning_rate": 7.23283261802575e-07,
"logits/chosen": -0.760424792766571,
"logits/rejected": -0.8070312738418579,
"logps/chosen": -382.125,
"logps/rejected": -431.8999938964844,
"loss": 0.0269,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": 0.2987060546875,
"rewards/margins": 9.362500190734863,
"rewards/rejected": -9.059765815734863,
"step": 2580
},
{
"epoch": 1.1111468726531488,
"grad_norm": 40.30443027517919,
"learning_rate": 7.222103004291845e-07,
"logits/chosen": -0.780566394329071,
"logits/rejected": -0.824511706829071,
"logps/chosen": -368.9750061035156,
"logps/rejected": -463.79998779296875,
"loss": 0.0367,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.04778594896197319,
"rewards/margins": 9.537890434265137,
"rewards/rejected": -9.589062690734863,
"step": 2590
},
{
"epoch": 1.115438257697672,
"grad_norm": 2.91081604718025,
"learning_rate": 7.21137339055794e-07,
"logits/chosen": -0.7046874761581421,
"logits/rejected": -0.7578369379043579,
"logps/chosen": -374.54998779296875,
"logps/rejected": -418.57501220703125,
"loss": 0.0397,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.2928222715854645,
"rewards/margins": 9.178906440734863,
"rewards/rejected": -9.471875190734863,
"step": 2600
},
{
"epoch": 1.119729642742195,
"grad_norm": 2.302094926567975,
"learning_rate": 7.200643776824034e-07,
"logits/chosen": -0.687207043170929,
"logits/rejected": -0.7332519292831421,
"logps/chosen": -363.75,
"logps/rejected": -423.75,
"loss": 0.0252,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": 0.654296875,
"rewards/margins": 9.546093940734863,
"rewards/rejected": -8.88671875,
"step": 2610
},
{
"epoch": 1.1240210277867182,
"grad_norm": 7.734768592289183,
"learning_rate": 7.189914163090129e-07,
"logits/chosen": -0.7929443120956421,
"logits/rejected": -0.801708996295929,
"logps/chosen": -345.3500061035156,
"logps/rejected": -417.5,
"loss": 0.0188,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": 0.852954089641571,
"rewards/margins": 10.467187881469727,
"rewards/rejected": -9.613672256469727,
"step": 2620
},
{
"epoch": 1.1283124128312414,
"grad_norm": 14.90668423249433,
"learning_rate": 7.179184549356223e-07,
"logits/chosen": -0.836474597454071,
"logits/rejected": -0.8541504144668579,
"logps/chosen": -360.2749938964844,
"logps/rejected": -462.9750061035156,
"loss": 0.0247,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.9029785394668579,
"rewards/margins": 11.117968559265137,
"rewards/rejected": -12.0078125,
"step": 2630
},
{
"epoch": 1.1326037978757644,
"grad_norm": 13.572432917845044,
"learning_rate": 7.168454935622317e-07,
"logits/chosen": -0.8270508050918579,
"logits/rejected": -0.8109375238418579,
"logps/chosen": -395.67498779296875,
"logps/rejected": -472.67498779296875,
"loss": 0.0707,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.8949340581893921,
"rewards/margins": 10.668749809265137,
"rewards/rejected": -11.560937881469727,
"step": 2640
},
{
"epoch": 1.1368951829202876,
"grad_norm": 2.3916939826930452,
"learning_rate": 7.157725321888411e-07,
"logits/chosen": -0.758618175983429,
"logits/rejected": -0.784423828125,
"logps/chosen": -371.45001220703125,
"logps/rejected": -457.7250061035156,
"loss": 0.0294,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.5729125738143921,
"rewards/margins": 10.409375190734863,
"rewards/rejected": -10.973437309265137,
"step": 2650
},
{
"epoch": 1.1411865679648105,
"grad_norm": 24.57237073545116,
"learning_rate": 7.146995708154506e-07,
"logits/chosen": -0.83740234375,
"logits/rejected": -0.8505859375,
"logps/chosen": -376.79998779296875,
"logps/rejected": -433.07501220703125,
"loss": 0.0265,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -0.10926513373851776,
"rewards/margins": 10.55859375,
"rewards/rejected": -10.669530868530273,
"step": 2660
},
{
"epoch": 1.1454779530093337,
"grad_norm": 12.976040034990163,
"learning_rate": 7.136266094420601e-07,
"logits/chosen": -0.801525890827179,
"logits/rejected": -0.822338879108429,
"logps/chosen": -344.45001220703125,
"logps/rejected": -405.79998779296875,
"loss": 0.0549,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.20175781846046448,
"rewards/margins": 9.954687118530273,
"rewards/rejected": -10.162500381469727,
"step": 2670
},
{
"epoch": 1.149769338053857,
"grad_norm": 21.156465403687218,
"learning_rate": 7.125536480686694e-07,
"logits/chosen": -0.8708251714706421,
"logits/rejected": -0.8871093988418579,
"logps/chosen": -357.32501220703125,
"logps/rejected": -441.32501220703125,
"loss": 0.0365,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.3420898914337158,
"rewards/margins": 10.209375381469727,
"rewards/rejected": -11.5546875,
"step": 2680
},
{
"epoch": 1.15406072309838,
"grad_norm": 23.06986252897006,
"learning_rate": 7.11480686695279e-07,
"logits/chosen": -0.8985351324081421,
"logits/rejected": -0.9410156011581421,
"logps/chosen": -357.17498779296875,
"logps/rejected": -445.2749938964844,
"loss": 0.0467,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.244421362876892,
"rewards/margins": 10.967187881469727,
"rewards/rejected": -12.209375381469727,
"step": 2690
},
{
"epoch": 1.1583521081429031,
"grad_norm": 29.63571617594808,
"learning_rate": 7.104077253218884e-07,
"logits/chosen": -0.806121826171875,
"logits/rejected": -0.8232666254043579,
"logps/chosen": -328.04998779296875,
"logps/rejected": -427.32501220703125,
"loss": 0.059,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 0.07687988132238388,
"rewards/margins": 9.431249618530273,
"rewards/rejected": -9.350000381469727,
"step": 2700
},
{
"epoch": 1.1626434931874263,
"grad_norm": 3.533641603488294,
"learning_rate": 7.093347639484978e-07,
"logits/chosen": -0.7093261480331421,
"logits/rejected": -0.755688488483429,
"logps/chosen": -367.9750061035156,
"logps/rejected": -465.70001220703125,
"loss": 0.0668,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.6290038824081421,
"rewards/margins": 11.038281440734863,
"rewards/rejected": -11.672266006469727,
"step": 2710
},
{
"epoch": 1.1669348782319493,
"grad_norm": 22.985807536024577,
"learning_rate": 7.082618025751073e-07,
"logits/chosen": -0.7316039800643921,
"logits/rejected": -0.7901366949081421,
"logps/chosen": -362.3500061035156,
"logps/rejected": -455.7250061035156,
"loss": 0.0454,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 0.3712524473667145,
"rewards/margins": 10.564844131469727,
"rewards/rejected": -10.193750381469727,
"step": 2720
},
{
"epoch": 1.1712262632764725,
"grad_norm": 7.632039371329289,
"learning_rate": 7.071888412017167e-07,
"logits/chosen": -0.7713378667831421,
"logits/rejected": -0.841259777545929,
"logps/chosen": -341.63751220703125,
"logps/rejected": -420.32501220703125,
"loss": 0.0352,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 0.0281982421875,
"rewards/margins": 9.876562118530273,
"rewards/rejected": -9.853906631469727,
"step": 2730
},
{
"epoch": 1.1755176483209957,
"grad_norm": 39.23964632567033,
"learning_rate": 7.061158798283261e-07,
"logits/chosen": -0.7262207269668579,
"logits/rejected": -0.739184558391571,
"logps/chosen": -312.9750061035156,
"logps/rejected": -401.9750061035156,
"loss": 0.0599,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.04046630859375,
"rewards/margins": 9.716796875,
"rewards/rejected": -9.757421493530273,
"step": 2740
},
{
"epoch": 1.1798090333655187,
"grad_norm": 0.3362127037141487,
"learning_rate": 7.050429184549355e-07,
"logits/chosen": -0.7503417730331421,
"logits/rejected": -0.8472656011581421,
"logps/chosen": -337.8999938964844,
"logps/rejected": -438.82501220703125,
"loss": 0.0379,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.022039771080017,
"rewards/margins": 10.184374809265137,
"rewards/rejected": -11.204687118530273,
"step": 2750
},
{
"epoch": 1.1841004184100419,
"grad_norm": 4.074310779489148,
"learning_rate": 7.03969957081545e-07,
"logits/chosen": -0.7583984136581421,
"logits/rejected": -0.826367199420929,
"logps/chosen": -373.38751220703125,
"logps/rejected": -436.4750061035156,
"loss": 0.0284,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.9810546636581421,
"rewards/margins": 11.284765243530273,
"rewards/rejected": -12.265625,
"step": 2760
},
{
"epoch": 1.1883918034545649,
"grad_norm": 0.877756042896416,
"learning_rate": 7.028969957081546e-07,
"logits/chosen": -0.8500000238418579,
"logits/rejected": -0.886425793170929,
"logps/chosen": -390.92498779296875,
"logps/rejected": -472.9750061035156,
"loss": 0.0278,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.941174328327179,
"rewards/margins": 11.620312690734863,
"rewards/rejected": -12.567187309265137,
"step": 2770
},
{
"epoch": 1.192683188499088,
"grad_norm": 26.86733553765975,
"learning_rate": 7.018240343347639e-07,
"logits/chosen": -0.8299316167831421,
"logits/rejected": -0.893872082233429,
"logps/chosen": -350.4125061035156,
"logps/rejected": -431.0249938964844,
"loss": 0.052,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.0543701648712158,
"rewards/margins": 10.25,
"rewards/rejected": -11.300000190734863,
"step": 2780
},
{
"epoch": 1.1969745735436113,
"grad_norm": 7.857861314661304,
"learning_rate": 7.007510729613734e-07,
"logits/chosen": -0.8516601324081421,
"logits/rejected": -0.8866211175918579,
"logps/chosen": -349.23748779296875,
"logps/rejected": -412.4750061035156,
"loss": 0.0736,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.607196033000946,
"rewards/margins": 9.149999618530273,
"rewards/rejected": -9.756250381469727,
"step": 2790
},
{
"epoch": 1.2012659585881342,
"grad_norm": 0.5826627106052477,
"learning_rate": 6.996781115879828e-07,
"logits/chosen": -0.841796875,
"logits/rejected": -0.8597656488418579,
"logps/chosen": -314.7250061035156,
"logps/rejected": -390.5249938964844,
"loss": 0.0503,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 0.20391845703125,
"rewards/margins": 9.140625,
"rewards/rejected": -8.932812690734863,
"step": 2800
},
{
"epoch": 1.2055573436326574,
"grad_norm": 26.811612128313687,
"learning_rate": 6.986051502145922e-07,
"logits/chosen": -0.888720691204071,
"logits/rejected": -0.911083996295929,
"logps/chosen": -356.6000061035156,
"logps/rejected": -426.61248779296875,
"loss": 0.078,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 0.18930664658546448,
"rewards/margins": 9.575780868530273,
"rewards/rejected": -9.387890815734863,
"step": 2810
},
{
"epoch": 1.2098487286771806,
"grad_norm": 4.121814312645254,
"learning_rate": 6.975321888412017e-07,
"logits/chosen": -0.8480468988418579,
"logits/rejected": -0.8599914312362671,
"logps/chosen": -387.5249938964844,
"logps/rejected": -451.125,
"loss": 0.0353,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 0.3008178770542145,
"rewards/margins": 10.2890625,
"rewards/rejected": -9.989843368530273,
"step": 2820
},
{
"epoch": 1.2141401137217036,
"grad_norm": 4.5248474916663675,
"learning_rate": 6.964592274678111e-07,
"logits/chosen": -0.8492676019668579,
"logits/rejected": -0.8797851800918579,
"logps/chosen": -394.7250061035156,
"logps/rejected": -451.4750061035156,
"loss": 0.0225,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.06778259575366974,
"rewards/margins": 10.164843559265137,
"rewards/rejected": -10.228906631469727,
"step": 2830
},
{
"epoch": 1.2184314987662268,
"grad_norm": 5.541312160188442,
"learning_rate": 6.953862660944206e-07,
"logits/chosen": -0.841796875,
"logits/rejected": -0.866406261920929,
"logps/chosen": -361.45001220703125,
"logps/rejected": -453.0249938964844,
"loss": 0.02,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": 0.06345214694738388,
"rewards/margins": 11.374218940734863,
"rewards/rejected": -11.317187309265137,
"step": 2840
},
{
"epoch": 1.22272288381075,
"grad_norm": 26.377008401638317,
"learning_rate": 6.9431330472103e-07,
"logits/chosen": -0.931640625,
"logits/rejected": -0.928515613079071,
"logps/chosen": -437.8500061035156,
"logps/rejected": -502.75,
"loss": 0.017,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.22867432236671448,
"rewards/margins": 11.522656440734863,
"rewards/rejected": -11.743749618530273,
"step": 2850
},
{
"epoch": 1.227014268855273,
"grad_norm": 6.870812485403802,
"learning_rate": 6.932403433476395e-07,
"logits/chosen": -0.9039551019668579,
"logits/rejected": -0.937548816204071,
"logps/chosen": -363.34375,
"logps/rejected": -436.57501220703125,
"loss": 0.0165,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.0352540016174316,
"rewards/margins": 11.083593368530273,
"rewards/rejected": -13.119531631469727,
"step": 2860
},
{
"epoch": 1.2313056538997962,
"grad_norm": 87.44948971323274,
"learning_rate": 6.921673819742489e-07,
"logits/chosen": -0.8780273199081421,
"logits/rejected": -0.889208972454071,
"logps/chosen": -390.54998779296875,
"logps/rejected": -473.8999938964844,
"loss": 0.0812,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.065527319908142,
"rewards/margins": 11.532812118530273,
"rewards/rejected": -12.608593940734863,
"step": 2870
},
{
"epoch": 1.2355970389443192,
"grad_norm": 22.858618765707323,
"learning_rate": 6.910944206008583e-07,
"logits/chosen": -0.8177734613418579,
"logits/rejected": -0.817578136920929,
"logps/chosen": -357.6000061035156,
"logps/rejected": -454.625,
"loss": 0.0265,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.5521606206893921,
"rewards/margins": 11.212499618530273,
"rewards/rejected": -11.760937690734863,
"step": 2880
},
{
"epoch": 1.2398884239888424,
"grad_norm": 3.405664659904639,
"learning_rate": 6.900214592274678e-07,
"logits/chosen": -0.8048340082168579,
"logits/rejected": -0.8421386480331421,
"logps/chosen": -355.9375,
"logps/rejected": -461.82501220703125,
"loss": 0.0509,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.609814465045929,
"rewards/margins": 11.509765625,
"rewards/rejected": -12.110937118530273,
"step": 2890
},
{
"epoch": 1.2441798090333656,
"grad_norm": 37.88277843642416,
"learning_rate": 6.889484978540772e-07,
"logits/chosen": -0.8687988519668579,
"logits/rejected": -0.910351574420929,
"logps/chosen": -385.32501220703125,
"logps/rejected": -450.70001220703125,
"loss": 0.0426,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.856909155845642,
"rewards/margins": 10.971875190734863,
"rewards/rejected": -12.822656631469727,
"step": 2900
},
{
"epoch": 1.2484711940778888,
"grad_norm": 44.66449596518931,
"learning_rate": 6.878755364806866e-07,
"logits/chosen": -0.89892578125,
"logits/rejected": -0.953320324420929,
"logps/chosen": -368.20001220703125,
"logps/rejected": -439.25,
"loss": 0.0538,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.863537549972534,
"rewards/margins": 11.170312881469727,
"rewards/rejected": -14.048437118530273,
"step": 2910
},
{
"epoch": 1.2527625791224117,
"grad_norm": 1.6280211293743867,
"learning_rate": 6.868025751072962e-07,
"logits/chosen": -0.8168090581893921,
"logits/rejected": -0.8503051996231079,
"logps/chosen": -364.5375061035156,
"logps/rejected": -471.04998779296875,
"loss": 0.0899,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -2.455078125,
"rewards/margins": 10.997655868530273,
"rewards/rejected": -13.453125,
"step": 2920
},
{
"epoch": 1.257053964166935,
"grad_norm": 40.97709466941475,
"learning_rate": 6.857296137339056e-07,
"logits/chosen": -0.8005126714706421,
"logits/rejected": -0.830078125,
"logps/chosen": -403.0375061035156,
"logps/rejected": -475.95001220703125,
"loss": 0.0342,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.4419463872909546,
"rewards/margins": 11.62109375,
"rewards/rejected": -13.057031631469727,
"step": 2930
},
{
"epoch": 1.261345349211458,
"grad_norm": 2.715054569843987,
"learning_rate": 6.84656652360515e-07,
"logits/chosen": -0.7897888422012329,
"logits/rejected": -0.8424316644668579,
"logps/chosen": -382.54998779296875,
"logps/rejected": -462.29998779296875,
"loss": 0.0314,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.0203368663787842,
"rewards/margins": 11.227343559265137,
"rewards/rejected": -12.250781059265137,
"step": 2940
},
{
"epoch": 1.265636734255981,
"grad_norm": 1.910852165802857,
"learning_rate": 6.835836909871244e-07,
"logits/chosen": -0.8514159917831421,
"logits/rejected": -0.892333984375,
"logps/chosen": -379.1000061035156,
"logps/rejected": -437.8999938964844,
"loss": 0.0381,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.2767517566680908,
"rewards/margins": 10.62109375,
"rewards/rejected": -11.896093368530273,
"step": 2950
},
{
"epoch": 1.2699281193005043,
"grad_norm": 263.47155980737926,
"learning_rate": 6.825107296137339e-07,
"logits/chosen": -0.870880126953125,
"logits/rejected": -0.881787121295929,
"logps/chosen": -404.375,
"logps/rejected": -486.82501220703125,
"loss": 0.0672,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.812725841999054,
"rewards/margins": 11.595312118530273,
"rewards/rejected": -12.4140625,
"step": 2960
},
{
"epoch": 1.2742195043450273,
"grad_norm": 2.6453361628214336,
"learning_rate": 6.814377682403433e-07,
"logits/chosen": -0.7888427972793579,
"logits/rejected": -0.8486083745956421,
"logps/chosen": -358.7749938964844,
"logps/rejected": -451.125,
"loss": 0.047,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.951403796672821,
"rewards/margins": 10.165624618530273,
"rewards/rejected": -11.111719131469727,
"step": 2970
},
{
"epoch": 1.2785108893895505,
"grad_norm": 40.41025891003457,
"learning_rate": 6.803648068669527e-07,
"logits/chosen": -0.8348144292831421,
"logits/rejected": -0.9014648199081421,
"logps/chosen": -410.2875061035156,
"logps/rejected": -471.2250061035156,
"loss": 0.0277,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.4649108946323395,
"rewards/margins": 11.67578125,
"rewards/rejected": -12.141406059265137,
"step": 2980
},
{
"epoch": 1.2828022744340735,
"grad_norm": 36.50133661236316,
"learning_rate": 6.792918454935622e-07,
"logits/chosen": -0.8729492425918579,
"logits/rejected": -0.9267578125,
"logps/chosen": -335.4750061035156,
"logps/rejected": -458.2749938964844,
"loss": 0.0395,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.5681518316268921,
"rewards/margins": 10.342187881469727,
"rewards/rejected": -10.915624618530273,
"step": 2990
},
{
"epoch": 1.2870936594785967,
"grad_norm": 7.674718113692602,
"learning_rate": 6.782188841201717e-07,
"logits/chosen": -0.843505859375,
"logits/rejected": -0.88232421875,
"logps/chosen": -367.125,
"logps/rejected": -440.1499938964844,
"loss": 0.0229,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -0.21315917372703552,
"rewards/margins": 10.846875190734863,
"rewards/rejected": -11.069531440734863,
"step": 3000
},
{
"epoch": 1.2913850445231199,
"grad_norm": 8.023624970801535,
"learning_rate": 6.771459227467811e-07,
"logits/chosen": -0.8708251714706421,
"logits/rejected": -0.882397472858429,
"logps/chosen": -405.5,
"logps/rejected": -483.8999938964844,
"loss": 0.0212,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -0.44740599393844604,
"rewards/margins": 10.907812118530273,
"rewards/rejected": -11.353124618530273,
"step": 3010
},
{
"epoch": 1.295676429567643,
"grad_norm": 0.8484430855200427,
"learning_rate": 6.760729613733906e-07,
"logits/chosen": -0.9527343511581421,
"logits/rejected": -0.948535144329071,
"logps/chosen": -393.7749938964844,
"logps/rejected": -492.95001220703125,
"loss": 0.0578,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.077123999595642,
"rewards/margins": 11.541406631469727,
"rewards/rejected": -12.615625381469727,
"step": 3020
},
{
"epoch": 1.299967814612166,
"grad_norm": 20.097868125405526,
"learning_rate": 6.75e-07,
"logits/chosen": -0.934765636920929,
"logits/rejected": -0.9468749761581421,
"logps/chosen": -411.625,
"logps/rejected": -464.32501220703125,
"loss": 0.0561,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.880200207233429,
"rewards/margins": 11.565625190734863,
"rewards/rejected": -12.44921875,
"step": 3030
},
{
"epoch": 1.3042591996566892,
"grad_norm": 49.158517994013735,
"learning_rate": 6.739270386266094e-07,
"logits/chosen": -0.887744128704071,
"logits/rejected": -0.9627929925918579,
"logps/chosen": -361.1625061035156,
"logps/rejected": -412.04998779296875,
"loss": 0.0607,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.02607421949505806,
"rewards/margins": 9.708593368530273,
"rewards/rejected": -9.742968559265137,
"step": 3040
},
{
"epoch": 1.3085505847012122,
"grad_norm": 1.6205881909254827,
"learning_rate": 6.728540772532188e-07,
"logits/chosen": -0.953320324420929,
"logits/rejected": -0.996142566204071,
"logps/chosen": -388.92498779296875,
"logps/rejected": -451.75,
"loss": 0.0361,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 0.4447387754917145,
"rewards/margins": 11.506250381469727,
"rewards/rejected": -11.071093559265137,
"step": 3050
},
{
"epoch": 1.3128419697457354,
"grad_norm": 19.552662385739566,
"learning_rate": 6.717811158798283e-07,
"logits/chosen": -0.8965820074081421,
"logits/rejected": -0.960742175579071,
"logps/chosen": -360.82501220703125,
"logps/rejected": -480.125,
"loss": 0.034,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.39521485567092896,
"rewards/margins": 11.825780868530273,
"rewards/rejected": -12.221094131469727,
"step": 3060
},
{
"epoch": 1.3171333547902586,
"grad_norm": 1.4849512594661396,
"learning_rate": 6.707081545064377e-07,
"logits/chosen": -0.965869128704071,
"logits/rejected": -0.987500011920929,
"logps/chosen": -361.6000061035156,
"logps/rejected": -458.6000061035156,
"loss": 0.0443,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.022216796875,
"rewards/margins": 11.507031440734863,
"rewards/rejected": -13.5234375,
"step": 3070
},
{
"epoch": 1.3214247398347818,
"grad_norm": 27.460062468197606,
"learning_rate": 6.696351931330472e-07,
"logits/chosen": -0.976757824420929,
"logits/rejected": -1.0224120616912842,
"logps/chosen": -406.95001220703125,
"logps/rejected": -455.54998779296875,
"loss": 0.0478,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.4090332984924316,
"rewards/margins": 12.051172256469727,
"rewards/rejected": -14.462499618530273,
"step": 3080
},
{
"epoch": 1.3257161248793048,
"grad_norm": 0.6392965356522042,
"learning_rate": 6.685622317596567e-07,
"logits/chosen": -0.9383544921875,
"logits/rejected": -1.003076195716858,
"logps/chosen": -386.1000061035156,
"logps/rejected": -482.25,
"loss": 0.0547,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.5667967796325684,
"rewards/margins": 12.789843559265137,
"rewards/rejected": -16.360937118530273,
"step": 3090
},
{
"epoch": 1.330007509923828,
"grad_norm": 5.355188149665065,
"learning_rate": 6.67489270386266e-07,
"logits/chosen": -0.96826171875,
"logits/rejected": -1.0000488758087158,
"logps/chosen": -414.5,
"logps/rejected": -471.54998779296875,
"loss": 0.0351,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.867480516433716,
"rewards/margins": 11.431249618530273,
"rewards/rejected": -15.298437118530273,
"step": 3100
},
{
"epoch": 1.334298894968351,
"grad_norm": 10.6816822027675,
"learning_rate": 6.664163090128755e-07,
"logits/chosen": -0.9092773199081421,
"logits/rejected": -0.967236340045929,
"logps/chosen": -373.2749938964844,
"logps/rejected": -477.1499938964844,
"loss": 0.0548,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.1260008811950684,
"rewards/margins": 12.357812881469727,
"rewards/rejected": -14.482812881469727,
"step": 3110
},
{
"epoch": 1.3385902800128742,
"grad_norm": 55.84987914140638,
"learning_rate": 6.65343347639485e-07,
"logits/chosen": -0.827197253704071,
"logits/rejected": -0.886914074420929,
"logps/chosen": -347.2875061035156,
"logps/rejected": -417.79998779296875,
"loss": 0.0744,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -0.746289074420929,
"rewards/margins": 10.245312690734863,
"rewards/rejected": -10.993749618530273,
"step": 3120
},
{
"epoch": 1.3428816650573974,
"grad_norm": 12.504389988513624,
"learning_rate": 6.642703862660944e-07,
"logits/chosen": -0.792041003704071,
"logits/rejected": -0.8616943359375,
"logps/chosen": -328.125,
"logps/rejected": -442.8500061035156,
"loss": 0.0528,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -0.819012463092804,
"rewards/margins": 10.645312309265137,
"rewards/rejected": -11.44921875,
"step": 3130
},
{
"epoch": 1.3471730501019203,
"grad_norm": 5.10389712400187,
"learning_rate": 6.631974248927038e-07,
"logits/chosen": -0.886157214641571,
"logits/rejected": -0.914990246295929,
"logps/chosen": -364.1499938964844,
"logps/rejected": -447.95001220703125,
"loss": 0.1306,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.21928711235523224,
"rewards/margins": 10.199609756469727,
"rewards/rejected": -10.417187690734863,
"step": 3140
},
{
"epoch": 1.3514644351464435,
"grad_norm": 13.306530408934037,
"learning_rate": 6.621244635193132e-07,
"logits/chosen": -0.86669921875,
"logits/rejected": -0.884228527545929,
"logps/chosen": -357.40625,
"logps/rejected": -459.75,
"loss": 0.0239,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.02045898512005806,
"rewards/margins": 12.219531059265137,
"rewards/rejected": -12.235937118530273,
"step": 3150
},
{
"epoch": 1.3557558201909665,
"grad_norm": 2.1072482395091865,
"learning_rate": 6.610515021459228e-07,
"logits/chosen": -0.919812023639679,
"logits/rejected": -0.9695800542831421,
"logps/chosen": -341.9125061035156,
"logps/rejected": -443.375,
"loss": 0.0403,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.7022949457168579,
"rewards/margins": 10.909375190734863,
"rewards/rejected": -11.614843368530273,
"step": 3160
},
{
"epoch": 1.3600472052354897,
"grad_norm": 5.629703901927869,
"learning_rate": 6.599785407725322e-07,
"logits/chosen": -0.8363281488418579,
"logits/rejected": -0.877307116985321,
"logps/chosen": -352.4750061035156,
"logps/rejected": -442.8500061035156,
"loss": 0.025,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.4149536192417145,
"rewards/margins": 11.703125,
"rewards/rejected": -12.123437881469727,
"step": 3170
},
{
"epoch": 1.364338590280013,
"grad_norm": 4.860320544615607,
"learning_rate": 6.589055793991416e-07,
"logits/chosen": -0.9039306640625,
"logits/rejected": -0.988476574420929,
"logps/chosen": -349.57501220703125,
"logps/rejected": -444.6499938964844,
"loss": 0.0475,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.4019286632537842,
"rewards/margins": 10.744531631469727,
"rewards/rejected": -12.150781631469727,
"step": 3180
},
{
"epoch": 1.3686299753245361,
"grad_norm": 4.037837096221678,
"learning_rate": 6.578326180257511e-07,
"logits/chosen": -0.901611328125,
"logits/rejected": -0.9452148675918579,
"logps/chosen": -370.3500061035156,
"logps/rejected": -462.1000061035156,
"loss": 0.0933,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.109643578529358,
"rewards/margins": 11.450780868530273,
"rewards/rejected": -12.568750381469727,
"step": 3190
},
{
"epoch": 1.372921360369059,
"grad_norm": 18.095349464306317,
"learning_rate": 6.567596566523604e-07,
"logits/chosen": -0.799792468547821,
"logits/rejected": -0.849194347858429,
"logps/chosen": -356.54998779296875,
"logps/rejected": -469.3500061035156,
"loss": 0.0607,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -1.1903808116912842,
"rewards/margins": 11.115625381469727,
"rewards/rejected": -12.303906440734863,
"step": 3200
},
{
"epoch": 1.3772127454135823,
"grad_norm": 35.88434976990525,
"learning_rate": 6.556866952789699e-07,
"logits/chosen": -0.8663085699081421,
"logits/rejected": -0.925793468952179,
"logps/chosen": -365.61248779296875,
"logps/rejected": -432.5249938964844,
"loss": 0.0286,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.6905395984649658,
"rewards/margins": 10.071093559265137,
"rewards/rejected": -11.756250381469727,
"step": 3210
},
{
"epoch": 1.3815041304581053,
"grad_norm": 73.23609788848009,
"learning_rate": 6.546137339055794e-07,
"logits/chosen": -0.8587890863418579,
"logits/rejected": -0.9124511480331421,
"logps/chosen": -362.0,
"logps/rejected": -456.5,
"loss": 0.0763,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -1.5350341796875,
"rewards/margins": 11.740625381469727,
"rewards/rejected": -13.271093368530273,
"step": 3220
},
{
"epoch": 1.3857955155026285,
"grad_norm": 0.7790833607907854,
"learning_rate": 6.535407725321889e-07,
"logits/chosen": -0.820599377155304,
"logits/rejected": -0.851245105266571,
"logps/chosen": -367.2875061035156,
"logps/rejected": -446.92498779296875,
"loss": 0.0627,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.3724365234375,
"rewards/margins": 10.6796875,
"rewards/rejected": -12.052343368530273,
"step": 3230
},
{
"epoch": 1.3900869005471517,
"grad_norm": 9.925110141823033,
"learning_rate": 6.524678111587983e-07,
"logits/chosen": -0.8824462890625,
"logits/rejected": -0.91156005859375,
"logps/chosen": -360.9750061035156,
"logps/rejected": -452.95001220703125,
"loss": 0.0441,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.72637939453125,
"rewards/margins": 11.247655868530273,
"rewards/rejected": -11.969922065734863,
"step": 3240
},
{
"epoch": 1.3943782855916746,
"grad_norm": 11.862398847089578,
"learning_rate": 6.513948497854077e-07,
"logits/chosen": -0.8667358160018921,
"logits/rejected": -0.925537109375,
"logps/chosen": -352.95001220703125,
"logps/rejected": -479.57501220703125,
"loss": 0.0464,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.000732421875,
"rewards/margins": 11.036328315734863,
"rewards/rejected": -12.036718368530273,
"step": 3250
},
{
"epoch": 1.3986696706361978,
"grad_norm": 52.12055214740879,
"learning_rate": 6.503218884120172e-07,
"logits/chosen": -0.904101550579071,
"logits/rejected": -0.958691418170929,
"logps/chosen": -352.2749938964844,
"logps/rejected": -464.79998779296875,
"loss": 0.033,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.6461181640625,
"rewards/margins": 11.440625190734863,
"rewards/rejected": -13.096875190734863,
"step": 3260
},
{
"epoch": 1.4029610556807208,
"grad_norm": 2.460546072361694,
"learning_rate": 6.492489270386266e-07,
"logits/chosen": -0.893994152545929,
"logits/rejected": -0.940869152545929,
"logps/chosen": -386.6499938964844,
"logps/rejected": -484.5249938964844,
"loss": 0.0189,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.015515089035034,
"rewards/margins": 11.568750381469727,
"rewards/rejected": -13.580469131469727,
"step": 3270
},
{
"epoch": 1.407252440725244,
"grad_norm": 73.79064857220027,
"learning_rate": 6.48175965665236e-07,
"logits/chosen": -0.993408203125,
"logits/rejected": -1.011474609375,
"logps/chosen": -360.23748779296875,
"logps/rejected": -452.7250061035156,
"loss": 0.0474,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.589679002761841,
"rewards/margins": 10.752344131469727,
"rewards/rejected": -13.3515625,
"step": 3280
},
{
"epoch": 1.4115438257697672,
"grad_norm": 2.4879505586418,
"learning_rate": 6.471030042918455e-07,
"logits/chosen": -0.9061523675918579,
"logits/rejected": -0.927441418170929,
"logps/chosen": -363.4750061035156,
"logps/rejected": -469.0,
"loss": 0.0743,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -2.492077589035034,
"rewards/margins": 11.246874809265137,
"rewards/rejected": -13.743749618530273,
"step": 3290
},
{
"epoch": 1.4158352108142904,
"grad_norm": 20.67310797004625,
"learning_rate": 6.460300429184548e-07,
"logits/chosen": -0.8389511108398438,
"logits/rejected": -0.887011706829071,
"logps/chosen": -342.45001220703125,
"logps/rejected": -440.70001220703125,
"loss": 0.0588,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -2.3333740234375,
"rewards/margins": 11.0390625,
"rewards/rejected": -13.37890625,
"step": 3300
},
{
"epoch": 1.4201265958588134,
"grad_norm": 27.45922221621303,
"learning_rate": 6.449570815450644e-07,
"logits/chosen": -0.848681628704071,
"logits/rejected": -0.859667956829071,
"logps/chosen": -399.2749938964844,
"logps/rejected": -490.1000061035156,
"loss": 0.0208,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -1.4686768054962158,
"rewards/margins": 12.849218368530273,
"rewards/rejected": -14.309374809265137,
"step": 3310
},
{
"epoch": 1.4244179809033366,
"grad_norm": 100.86499383327056,
"learning_rate": 6.438841201716739e-07,
"logits/chosen": -0.788226306438446,
"logits/rejected": -0.841064453125,
"logps/chosen": -361.6499938964844,
"logps/rejected": -470.13751220703125,
"loss": 0.09,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -2.818530321121216,
"rewards/margins": 11.14453125,
"rewards/rejected": -13.959375381469727,
"step": 3320
},
{
"epoch": 1.4287093659478596,
"grad_norm": 15.527156967901591,
"learning_rate": 6.428111587982832e-07,
"logits/chosen": -0.914257824420929,
"logits/rejected": -0.981640636920929,
"logps/chosen": -441.42498779296875,
"logps/rejected": -521.8499755859375,
"loss": 0.0553,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.0823700428009033,
"rewards/margins": 13.349218368530273,
"rewards/rejected": -15.4296875,
"step": 3330
},
{
"epoch": 1.4330007509923828,
"grad_norm": 5.138597307024332,
"learning_rate": 6.417381974248927e-07,
"logits/chosen": -0.915576159954071,
"logits/rejected": -0.934326171875,
"logps/chosen": -408.82501220703125,
"logps/rejected": -495.8999938964844,
"loss": 0.023,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -1.8404541015625,
"rewards/margins": 12.379687309265137,
"rewards/rejected": -14.21875,
"step": 3340
},
{
"epoch": 1.437292136036906,
"grad_norm": 30.739236838663548,
"learning_rate": 6.406652360515021e-07,
"logits/chosen": -0.907763659954071,
"logits/rejected": -0.9356933832168579,
"logps/chosen": -383.23748779296875,
"logps/rejected": -465.42498779296875,
"loss": 0.0697,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.17578125,
"rewards/margins": 11.319531440734863,
"rewards/rejected": -12.500781059265137,
"step": 3350
},
{
"epoch": 1.441583521081429,
"grad_norm": 72.15085958322028,
"learning_rate": 6.395922746781116e-07,
"logits/chosen": -0.8552001714706421,
"logits/rejected": -0.8736327886581421,
"logps/chosen": -395.13751220703125,
"logps/rejected": -495.2250061035156,
"loss": 0.0325,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.1392700672149658,
"rewards/margins": 11.385156631469727,
"rewards/rejected": -12.53125,
"step": 3360
},
{
"epoch": 1.4458749061259522,
"grad_norm": 0.08641280978616944,
"learning_rate": 6.385193133047209e-07,
"logits/chosen": -0.9839843511581421,
"logits/rejected": -1.024804711341858,
"logps/chosen": -364.42498779296875,
"logps/rejected": -436.8500061035156,
"loss": 0.0635,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.2257232666015625,
"rewards/margins": 10.419530868530273,
"rewards/rejected": -11.639062881469727,
"step": 3370
},
{
"epoch": 1.4501662911704754,
"grad_norm": 82.77325381607612,
"learning_rate": 6.374463519313304e-07,
"logits/chosen": -0.952587902545929,
"logits/rejected": -1.029150366783142,
"logps/chosen": -361.875,
"logps/rejected": -440.1000061035156,
"loss": 0.149,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -1.9668457508087158,
"rewards/margins": 10.737500190734863,
"rewards/rejected": -12.696874618530273,
"step": 3380
},
{
"epoch": 1.4544576762149983,
"grad_norm": 11.201184849575593,
"learning_rate": 6.3637339055794e-07,
"logits/chosen": -0.8238525390625,
"logits/rejected": -0.865795910358429,
"logps/chosen": -362.76251220703125,
"logps/rejected": -442.82501220703125,
"loss": 0.0466,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.965649425983429,
"rewards/margins": 10.416796684265137,
"rewards/rejected": -11.377344131469727,
"step": 3390
},
{
"epoch": 1.4587490612595215,
"grad_norm": 28.645591372671245,
"learning_rate": 6.353004291845493e-07,
"logits/chosen": -0.8511962890625,
"logits/rejected": -0.904370129108429,
"logps/chosen": -375.67498779296875,
"logps/rejected": -420.375,
"loss": 0.0492,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.15196533501148224,
"rewards/margins": 9.792187690734863,
"rewards/rejected": -9.948437690734863,
"step": 3400
},
{
"epoch": 1.4630404463040447,
"grad_norm": 18.72589477248601,
"learning_rate": 6.342274678111588e-07,
"logits/chosen": -0.884960949420929,
"logits/rejected": -0.93994140625,
"logps/chosen": -362.95001220703125,
"logps/rejected": -443.375,
"loss": 0.0542,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": 0.6876281499862671,
"rewards/margins": 10.577343940734863,
"rewards/rejected": -9.887890815734863,
"step": 3410
},
{
"epoch": 1.4673318313485677,
"grad_norm": 37.42507430124475,
"learning_rate": 6.331545064377683e-07,
"logits/chosen": -0.9524902105331421,
"logits/rejected": -0.952258288860321,
"logps/chosen": -366.8999938964844,
"logps/rejected": -467.70001220703125,
"loss": 0.0419,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.40147703886032104,
"rewards/margins": 10.142969131469727,
"rewards/rejected": -10.545312881469727,
"step": 3420
},
{
"epoch": 1.471623216393091,
"grad_norm": 4.108013106392496,
"learning_rate": 6.320815450643776e-07,
"logits/chosen": -0.9612792730331421,
"logits/rejected": -0.9871581792831421,
"logps/chosen": -379.13751220703125,
"logps/rejected": -471.95001220703125,
"loss": 0.0425,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.687084972858429,
"rewards/margins": 11.103124618530273,
"rewards/rejected": -11.796093940734863,
"step": 3430
},
{
"epoch": 1.4759146014376139,
"grad_norm": 11.298846121119066,
"learning_rate": 6.310085836909871e-07,
"logits/chosen": -0.996289074420929,
"logits/rejected": -1.025488257408142,
"logps/chosen": -388.0249938964844,
"logps/rejected": -453.70001220703125,
"loss": 0.0398,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.0525145530700684,
"rewards/margins": 11.0234375,
"rewards/rejected": -13.068750381469727,
"step": 3440
},
{
"epoch": 1.480205986482137,
"grad_norm": 9.573571871020905,
"learning_rate": 6.299356223175965e-07,
"logits/chosen": -1.032128930091858,
"logits/rejected": -1.0539062023162842,
"logps/chosen": -383.125,
"logps/rejected": -461.1000061035156,
"loss": 0.0311,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.744970679283142,
"rewards/margins": 11.297656059265137,
"rewards/rejected": -13.029687881469727,
"step": 3450
},
{
"epoch": 1.4844973715266603,
"grad_norm": 6.539920807912932,
"learning_rate": 6.288626609442059e-07,
"logits/chosen": -0.959033191204071,
"logits/rejected": -0.9933105707168579,
"logps/chosen": -379.45001220703125,
"logps/rejected": -457.1000061035156,
"loss": 0.0382,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.4843261241912842,
"rewards/margins": 11.4921875,
"rewards/rejected": -12.977343559265137,
"step": 3460
},
{
"epoch": 1.4887887565711835,
"grad_norm": 45.07064251767986,
"learning_rate": 6.277896995708153e-07,
"logits/chosen": -1.010156273841858,
"logits/rejected": -1.030859351158142,
"logps/chosen": -374.8999938964844,
"logps/rejected": -456.45001220703125,
"loss": 0.0535,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.559667944908142,
"rewards/margins": 10.966405868530273,
"rewards/rejected": -12.53125,
"step": 3470
},
{
"epoch": 1.4930801416157065,
"grad_norm": 21.773530122368797,
"learning_rate": 6.267167381974249e-07,
"logits/chosen": -0.9640868902206421,
"logits/rejected": -0.977099597454071,
"logps/chosen": -355.75,
"logps/rejected": -444.29998779296875,
"loss": 0.0326,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.6719635128974915,
"rewards/margins": 11.660937309265137,
"rewards/rejected": -12.331250190734863,
"step": 3480
},
{
"epoch": 1.4973715266602297,
"grad_norm": 22.277100761238152,
"learning_rate": 6.256437768240344e-07,
"logits/chosen": -1.01171875,
"logits/rejected": -1.056396484375,
"logps/chosen": -359.45001220703125,
"logps/rejected": -472.875,
"loss": 0.0345,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.42729490995407104,
"rewards/margins": 12.108593940734863,
"rewards/rejected": -12.538281440734863,
"step": 3490
},
{
"epoch": 1.5016629117047526,
"grad_norm": 3.5957062667518778,
"learning_rate": 6.245708154506437e-07,
"logits/chosen": -0.9813476800918579,
"logits/rejected": -1.0085937976837158,
"logps/chosen": -367.88751220703125,
"logps/rejected": -451.1499938964844,
"loss": 0.0721,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -0.3477416932582855,
"rewards/margins": 11.082812309265137,
"rewards/rejected": -11.432031631469727,
"step": 3500
},
{
"epoch": 1.5059542967492758,
"grad_norm": 4.917160245072736,
"learning_rate": 6.234978540772532e-07,
"logits/chosen": -1.0276367664337158,
"logits/rejected": -1.061425805091858,
"logps/chosen": -369.32501220703125,
"logps/rejected": -471.125,
"loss": 0.0404,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.6171020269393921,
"rewards/margins": 11.725000381469727,
"rewards/rejected": -12.339062690734863,
"step": 3510
},
{
"epoch": 1.510245681793799,
"grad_norm": 124.9174010662355,
"learning_rate": 6.224248927038627e-07,
"logits/chosen": -0.9134765863418579,
"logits/rejected": -0.9443359375,
"logps/chosen": -380.32501220703125,
"logps/rejected": -466.95001220703125,
"loss": 0.0731,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -1.318139672279358,
"rewards/margins": 11.22265625,
"rewards/rejected": -12.540624618530273,
"step": 3520
},
{
"epoch": 1.5145370668383222,
"grad_norm": 39.454257922741654,
"learning_rate": 6.21351931330472e-07,
"logits/chosen": -0.896533191204071,
"logits/rejected": -0.97119140625,
"logps/chosen": -381.79998779296875,
"logps/rejected": -469.20001220703125,
"loss": 0.0599,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.8893616199493408,
"rewards/margins": 11.817187309265137,
"rewards/rejected": -13.703125,
"step": 3530
},
{
"epoch": 1.5188284518828452,
"grad_norm": 16.748630995113967,
"learning_rate": 6.202789699570815e-07,
"logits/chosen": -1.1181640625,
"logits/rejected": -1.141015648841858,
"logps/chosen": -393.0249938964844,
"logps/rejected": -480.07501220703125,
"loss": 0.0285,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.777185082435608,
"rewards/margins": 11.828906059265137,
"rewards/rejected": -13.604687690734863,
"step": 3540
},
{
"epoch": 1.5231198369273682,
"grad_norm": 27.06889714766912,
"learning_rate": 6.19206008583691e-07,
"logits/chosen": -1.0304687023162842,
"logits/rejected": -1.0901367664337158,
"logps/chosen": -376.75,
"logps/rejected": -456.32501220703125,
"loss": 0.0399,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.6439940929412842,
"rewards/margins": 11.532812118530273,
"rewards/rejected": -13.173437118530273,
"step": 3550
},
{
"epoch": 1.5274112219718914,
"grad_norm": 12.346708553639452,
"learning_rate": 6.181330472103004e-07,
"logits/chosen": -0.93798828125,
"logits/rejected": -1.017333984375,
"logps/chosen": -358.48748779296875,
"logps/rejected": -449.20001220703125,
"loss": 0.043,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.921130359172821,
"rewards/margins": 10.507031440734863,
"rewards/rejected": -11.431249618530273,
"step": 3560
},
{
"epoch": 1.5317026070164146,
"grad_norm": 17.240386928961588,
"learning_rate": 6.170600858369098e-07,
"logits/chosen": -1.028466820716858,
"logits/rejected": -1.0939452648162842,
"logps/chosen": -388.1499938964844,
"logps/rejected": -466.79998779296875,
"loss": 0.0443,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 0.1668701171875,
"rewards/margins": 11.296875,
"rewards/rejected": -11.134374618530273,
"step": 3570
},
{
"epoch": 1.5359939920609378,
"grad_norm": 7.925542237496129,
"learning_rate": 6.159871244635193e-07,
"logits/chosen": -1.050878882408142,
"logits/rejected": -1.0861327648162842,
"logps/chosen": -350.23748779296875,
"logps/rejected": -453.6000061035156,
"loss": 0.021,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.07758788764476776,
"rewards/margins": 10.716405868530273,
"rewards/rejected": -10.796875,
"step": 3580
},
{
"epoch": 1.5402853771054608,
"grad_norm": 52.56466961019095,
"learning_rate": 6.149141630901288e-07,
"logits/chosen": -1.0403320789337158,
"logits/rejected": -1.057226538658142,
"logps/chosen": -328.20001220703125,
"logps/rejected": -420.54998779296875,
"loss": 0.1081,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -1.152563452720642,
"rewards/margins": 10.215039253234863,
"rewards/rejected": -11.369336128234863,
"step": 3590
},
{
"epoch": 1.544576762149984,
"grad_norm": 20.27197244135147,
"learning_rate": 6.138412017167381e-07,
"logits/chosen": -0.971923828125,
"logits/rejected": -1.02294921875,
"logps/chosen": -353.73748779296875,
"logps/rejected": -447.57501220703125,
"loss": 0.0199,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.41986083984375,
"rewards/margins": 11.297656059265137,
"rewards/rejected": -10.87890625,
"step": 3600
},
{
"epoch": 1.548868147194507,
"grad_norm": 15.161298138441703,
"learning_rate": 6.127682403433476e-07,
"logits/chosen": -1.034204125404358,
"logits/rejected": -1.080810546875,
"logps/chosen": -364.7250061035156,
"logps/rejected": -451.57501220703125,
"loss": 0.0516,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": 1.055029273033142,
"rewards/margins": 10.393750190734863,
"rewards/rejected": -9.3359375,
"step": 3610
},
{
"epoch": 1.5531595322390301,
"grad_norm": 5.131590755196448,
"learning_rate": 6.11695278969957e-07,
"logits/chosen": -1.0348632335662842,
"logits/rejected": -1.0750000476837158,
"logps/chosen": -351.03125,
"logps/rejected": -450.57501220703125,
"loss": 0.0249,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.06328125298023224,
"rewards/margins": 10.162500381469727,
"rewards/rejected": -10.220703125,
"step": 3620
},
{
"epoch": 1.5574509172835533,
"grad_norm": 26.73930536393512,
"learning_rate": 6.106223175965665e-07,
"logits/chosen": -0.9801880121231079,
"logits/rejected": -0.9995361566543579,
"logps/chosen": -342.5375061035156,
"logps/rejected": -418.0,
"loss": 0.062,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.30524903535842896,
"rewards/margins": 9.898046493530273,
"rewards/rejected": -10.20703125,
"step": 3630
},
{
"epoch": 1.5617423023280765,
"grad_norm": 4.241567091111774,
"learning_rate": 6.09549356223176e-07,
"logits/chosen": -1.0172851085662842,
"logits/rejected": -1.042456030845642,
"logps/chosen": -374.82501220703125,
"logps/rejected": -455.45001220703125,
"loss": 0.0434,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.5003417730331421,
"rewards/margins": 11.211718559265137,
"rewards/rejected": -11.712499618530273,
"step": 3640
},
{
"epoch": 1.5660336873725995,
"grad_norm": 11.55841738570082,
"learning_rate": 6.084763948497854e-07,
"logits/chosen": -0.9365234375,
"logits/rejected": -0.9844726324081421,
"logps/chosen": -385.5249938964844,
"logps/rejected": -474.95001220703125,
"loss": 0.107,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -1.064538598060608,
"rewards/margins": 10.694531440734863,
"rewards/rejected": -11.749218940734863,
"step": 3650
},
{
"epoch": 1.5703250724171225,
"grad_norm": 18.012969322287542,
"learning_rate": 6.074034334763948e-07,
"logits/chosen": -1.0526854991912842,
"logits/rejected": -1.085205078125,
"logps/chosen": -367.3125,
"logps/rejected": -459.32501220703125,
"loss": 0.0513,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.0918700695037842,
"rewards/margins": 11.31640625,
"rewards/rejected": -12.410937309265137,
"step": 3660
},
{
"epoch": 1.5746164574616457,
"grad_norm": 7.8670591121164835,
"learning_rate": 6.063304721030042e-07,
"logits/chosen": -0.9852660894393921,
"logits/rejected": -1.0500609874725342,
"logps/chosen": -376.9624938964844,
"logps/rejected": -484.0249938964844,
"loss": 0.0781,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.945361316204071,
"rewards/margins": 12.44921875,
"rewards/rejected": -13.397656440734863,
"step": 3670
},
{
"epoch": 1.578907842506169,
"grad_norm": 10.443051178099875,
"learning_rate": 6.052575107296137e-07,
"logits/chosen": -0.99615478515625,
"logits/rejected": -1.068457007408142,
"logps/chosen": -412.875,
"logps/rejected": -499.8999938964844,
"loss": 0.0289,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.360693335533142,
"rewards/margins": 11.412500381469727,
"rewards/rejected": -12.767969131469727,
"step": 3680
},
{
"epoch": 1.583199227550692,
"grad_norm": 5.296962907358093,
"learning_rate": 6.041845493562231e-07,
"logits/chosen": -1.0727050304412842,
"logits/rejected": -1.1242187023162842,
"logps/chosen": -350.5249938964844,
"logps/rejected": -441.82501220703125,
"loss": 0.0386,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.6430175304412842,
"rewards/margins": 11.55859375,
"rewards/rejected": -13.203125,
"step": 3690
},
{
"epoch": 1.587490612595215,
"grad_norm": 2.230846412563901,
"learning_rate": 6.031115879828325e-07,
"logits/chosen": -0.994189441204071,
"logits/rejected": -1.039453148841858,
"logps/chosen": -363.2250061035156,
"logps/rejected": -476.1000061035156,
"loss": 0.0633,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -1.7603027820587158,
"rewards/margins": 10.814453125,
"rewards/rejected": -12.578125,
"step": 3700
},
{
"epoch": 1.5917819976397383,
"grad_norm": 11.68472547219547,
"learning_rate": 6.020386266094421e-07,
"logits/chosen": -1.108496069908142,
"logits/rejected": -1.1541016101837158,
"logps/chosen": -369.45001220703125,
"logps/rejected": -497.75,
"loss": 0.0088,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.591455101966858,
"rewards/margins": 12.387499809265137,
"rewards/rejected": -13.973437309265137,
"step": 3710
},
{
"epoch": 1.5960733826842612,
"grad_norm": 15.161777954421922,
"learning_rate": 6.009656652360515e-07,
"logits/chosen": -1.1013672351837158,
"logits/rejected": -1.1129882335662842,
"logps/chosen": -419.3999938964844,
"logps/rejected": -487.6499938964844,
"loss": 0.0336,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -1.280175805091858,
"rewards/margins": 11.493749618530273,
"rewards/rejected": -12.779687881469727,
"step": 3720
},
{
"epoch": 1.6003647677287844,
"grad_norm": 46.747152388521656,
"learning_rate": 5.998927038626609e-07,
"logits/chosen": -1.000585913658142,
"logits/rejected": -1.0385253429412842,
"logps/chosen": -369.0,
"logps/rejected": -435.29998779296875,
"loss": 0.0755,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.6717529296875,
"rewards/margins": 11.267578125,
"rewards/rejected": -12.938281059265137,
"step": 3730
},
{
"epoch": 1.6046561527733076,
"grad_norm": 4.610886513347477,
"learning_rate": 5.988197424892704e-07,
"logits/chosen": -1.032128930091858,
"logits/rejected": -1.055566430091858,
"logps/chosen": -352.0,
"logps/rejected": -488.95001220703125,
"loss": 0.0438,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.308349609375,
"rewards/margins": 12.499218940734863,
"rewards/rejected": -13.817187309265137,
"step": 3740
},
{
"epoch": 1.6089475378178308,
"grad_norm": 2.12022158001016,
"learning_rate": 5.977467811158798e-07,
"logits/chosen": -1.066015601158142,
"logits/rejected": -1.093017578125,
"logps/chosen": -365.5,
"logps/rejected": -434.1499938964844,
"loss": 0.0374,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.0483887195587158,
"rewards/margins": 10.621874809265137,
"rewards/rejected": -11.671093940734863,
"step": 3750
},
{
"epoch": 1.6132389228623538,
"grad_norm": 7.3791654757765,
"learning_rate": 5.966738197424892e-07,
"logits/chosen": -1.073974609375,
"logits/rejected": -1.0671173334121704,
"logps/chosen": -380.57501220703125,
"logps/rejected": -484.5,
"loss": 0.0901,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.2013671398162842,
"rewards/margins": 11.805078506469727,
"rewards/rejected": -13.010937690734863,
"step": 3760
},
{
"epoch": 1.6175303079068768,
"grad_norm": 6.726731150209308,
"learning_rate": 5.956008583690986e-07,
"logits/chosen": -0.9701172113418579,
"logits/rejected": -0.9835449457168579,
"logps/chosen": -362.1000061035156,
"logps/rejected": -495.2250061035156,
"loss": 0.0408,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.4636474549770355,
"rewards/margins": 12.257031440734863,
"rewards/rejected": -12.715624809265137,
"step": 3770
},
{
"epoch": 1.6218216929514,
"grad_norm": 3.283700623134968,
"learning_rate": 5.945278969957081e-07,
"logits/chosen": -1.0281982421875,
"logits/rejected": -1.0763671398162842,
"logps/chosen": -373.25,
"logps/rejected": -461.5249938964844,
"loss": 0.0363,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.326806664466858,
"rewards/margins": 10.408594131469727,
"rewards/rejected": -11.733593940734863,
"step": 3780
},
{
"epoch": 1.6261130779959232,
"grad_norm": 46.263555191190605,
"learning_rate": 5.934549356223176e-07,
"logits/chosen": -1.0485351085662842,
"logits/rejected": -1.0465819835662842,
"logps/chosen": -334.1000061035156,
"logps/rejected": -428.2250061035156,
"loss": 0.0653,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.558642566204071,
"rewards/margins": 10.5,
"rewards/rejected": -11.052343368530273,
"step": 3790
},
{
"epoch": 1.6304044630404464,
"grad_norm": 70.58914327261067,
"learning_rate": 5.92381974248927e-07,
"logits/chosen": -0.9837890863418579,
"logits/rejected": -0.9887939691543579,
"logps/chosen": -373.67498779296875,
"logps/rejected": -460.2250061035156,
"loss": 0.0614,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.5447021722793579,
"rewards/margins": 10.692187309265137,
"rewards/rejected": -11.242968559265137,
"step": 3800
},
{
"epoch": 1.6346958480849694,
"grad_norm": 9.551501688796025,
"learning_rate": 5.913090128755365e-07,
"logits/chosen": -0.9583495855331421,
"logits/rejected": -1.0110352039337158,
"logps/chosen": -355.875,
"logps/rejected": -438.8999938964844,
"loss": 0.0437,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.19427490234375,
"rewards/margins": 10.16796875,
"rewards/rejected": -10.365625381469727,
"step": 3810
},
{
"epoch": 1.6389872331294926,
"grad_norm": 9.735697658639353,
"learning_rate": 5.902360515021459e-07,
"logits/chosen": -0.991137683391571,
"logits/rejected": -1.012597680091858,
"logps/chosen": -402.5,
"logps/rejected": -464.6499938964844,
"loss": 0.1226,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.716552734375,
"rewards/margins": 10.024999618530273,
"rewards/rejected": -10.742968559265137,
"step": 3820
},
{
"epoch": 1.6432786181740155,
"grad_norm": 134.6426067063096,
"learning_rate": 5.891630901287553e-07,
"logits/chosen": -0.966601550579071,
"logits/rejected": -0.9903320074081421,
"logps/chosen": -344.29998779296875,
"logps/rejected": -436.4750061035156,
"loss": 0.0521,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.16999511420726776,
"rewards/margins": 10.494531631469727,
"rewards/rejected": -10.666406631469727,
"step": 3830
},
{
"epoch": 1.6475700032185387,
"grad_norm": 2.0498518632404643,
"learning_rate": 5.880901287553648e-07,
"logits/chosen": -0.9258788824081421,
"logits/rejected": -0.9781738519668579,
"logps/chosen": -395.3500061035156,
"logps/rejected": -452.125,
"loss": 0.0418,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.5118042230606079,
"rewards/margins": 9.500781059265137,
"rewards/rejected": -10.008593559265137,
"step": 3840
},
{
"epoch": 1.651861388263062,
"grad_norm": 0.11991663763700955,
"learning_rate": 5.870171673819742e-07,
"logits/chosen": -0.877124011516571,
"logits/rejected": -0.90020751953125,
"logps/chosen": -331.8125,
"logps/rejected": -450.54998779296875,
"loss": 0.04,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.05183105543255806,
"rewards/margins": 11.319531440734863,
"rewards/rejected": -11.373437881469727,
"step": 3850
},
{
"epoch": 1.6561527733075851,
"grad_norm": 21.277396660430856,
"learning_rate": 5.859442060085836e-07,
"logits/chosen": -0.9910644292831421,
"logits/rejected": -1.045507788658142,
"logps/chosen": -400.4750061035156,
"logps/rejected": -477.95001220703125,
"loss": 0.0675,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 0.4636291563510895,
"rewards/margins": 11.4921875,
"rewards/rejected": -11.025781631469727,
"step": 3860
},
{
"epoch": 1.6604441583521081,
"grad_norm": 5.9248262913392695,
"learning_rate": 5.848712446351931e-07,
"logits/chosen": -0.88916015625,
"logits/rejected": -0.940991222858429,
"logps/chosen": -360.45001220703125,
"logps/rejected": -454.17498779296875,
"loss": 0.0577,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.8077758550643921,
"rewards/margins": 10.555468559265137,
"rewards/rejected": -11.360156059265137,
"step": 3870
},
{
"epoch": 1.664735543396631,
"grad_norm": 5.636344279914434,
"learning_rate": 5.837982832618026e-07,
"logits/chosen": -0.971386730670929,
"logits/rejected": -1.02880859375,
"logps/chosen": -363.82501220703125,
"logps/rejected": -435.125,
"loss": 0.1098,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.787792980670929,
"rewards/margins": 11.44140625,
"rewards/rejected": -12.232812881469727,
"step": 3880
},
{
"epoch": 1.6690269284411543,
"grad_norm": 24.121842854189637,
"learning_rate": 5.82725321888412e-07,
"logits/chosen": -0.909912109375,
"logits/rejected": -0.9408935308456421,
"logps/chosen": -340.95001220703125,
"logps/rejected": -436.4750061035156,
"loss": 0.1015,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -0.77166748046875,
"rewards/margins": 11.192968368530273,
"rewards/rejected": -11.967968940734863,
"step": 3890
},
{
"epoch": 1.6733183134856775,
"grad_norm": 13.088354166874673,
"learning_rate": 5.816523605150214e-07,
"logits/chosen": -0.985644519329071,
"logits/rejected": -1.042333960533142,
"logps/chosen": -377.04998779296875,
"logps/rejected": -444.8999938964844,
"loss": 0.0334,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.29119873046875,
"rewards/margins": 10.6875,
"rewards/rejected": -11.982812881469727,
"step": 3900
},
{
"epoch": 1.6776096985302007,
"grad_norm": 10.340463453342215,
"learning_rate": 5.805793991416309e-07,
"logits/chosen": -0.94921875,
"logits/rejected": -1.012304663658142,
"logps/chosen": -359.6000061035156,
"logps/rejected": -472.0249938964844,
"loss": 0.0473,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.7431091070175171,
"rewards/margins": 11.539843559265137,
"rewards/rejected": -12.279687881469727,
"step": 3910
},
{
"epoch": 1.681901083574724,
"grad_norm": 1.4418473392006272,
"learning_rate": 5.795064377682402e-07,
"logits/chosen": -0.917773425579071,
"logits/rejected": -0.9466797113418579,
"logps/chosen": -340.67498779296875,
"logps/rejected": -426.3999938964844,
"loss": 0.0836,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.956042468547821,
"rewards/margins": 10.712499618530273,
"rewards/rejected": -11.675000190734863,
"step": 3920
},
{
"epoch": 1.6861924686192469,
"grad_norm": 3.427322931850794,
"learning_rate": 5.784334763948497e-07,
"logits/chosen": -0.878613293170929,
"logits/rejected": -0.9514404535293579,
"logps/chosen": -389.4624938964844,
"logps/rejected": -471.32501220703125,
"loss": 0.0432,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.8802734613418579,
"rewards/margins": 10.985937118530273,
"rewards/rejected": -11.862500190734863,
"step": 3930
},
{
"epoch": 1.6904838536637699,
"grad_norm": 49.213936872673436,
"learning_rate": 5.773605150214593e-07,
"logits/chosen": -0.987988293170929,
"logits/rejected": -1.0217773914337158,
"logps/chosen": -400.29998779296875,
"logps/rejected": -487.95001220703125,
"loss": 0.0239,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.957409679889679,
"rewards/margins": 11.645312309265137,
"rewards/rejected": -12.603124618530273,
"step": 3940
},
{
"epoch": 1.694775238708293,
"grad_norm": 1.7707211425103353,
"learning_rate": 5.762875536480687e-07,
"logits/chosen": -0.9774414300918579,
"logits/rejected": -0.999707043170929,
"logps/chosen": -378.54998779296875,
"logps/rejected": -487.3999938964844,
"loss": 0.0141,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.3688598573207855,
"rewards/margins": 11.663281440734863,
"rewards/rejected": -12.035937309265137,
"step": 3950
},
{
"epoch": 1.6990666237528163,
"grad_norm": 68.9402764828647,
"learning_rate": 5.752145922746781e-07,
"logits/chosen": -0.8727051019668579,
"logits/rejected": -0.893115222454071,
"logps/chosen": -366.42498779296875,
"logps/rejected": -456.1000061035156,
"loss": 0.0269,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.109838843345642,
"rewards/margins": 11.327343940734863,
"rewards/rejected": -12.435937881469727,
"step": 3960
},
{
"epoch": 1.7033580087973395,
"grad_norm": 20.086796671432815,
"learning_rate": 5.741416309012875e-07,
"logits/chosen": -1.0078125,
"logits/rejected": -1.0475585460662842,
"logps/chosen": -386.54998779296875,
"logps/rejected": -482.5,
"loss": 0.0103,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.840234398841858,
"rewards/margins": 11.315625190734863,
"rewards/rejected": -13.162500381469727,
"step": 3970
},
{
"epoch": 1.7076493938418624,
"grad_norm": 9.260172986644193,
"learning_rate": 5.73068669527897e-07,
"logits/chosen": -0.951904296875,
"logits/rejected": -0.9915527105331421,
"logps/chosen": -344.6000061035156,
"logps/rejected": -448.07501220703125,
"loss": 0.0668,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -0.832019031047821,
"rewards/margins": 11.274999618530273,
"rewards/rejected": -12.108593940734863,
"step": 3980
},
{
"epoch": 1.7119407788863856,
"grad_norm": 57.237223091711535,
"learning_rate": 5.719957081545064e-07,
"logits/chosen": -0.9855591058731079,
"logits/rejected": -1.035546898841858,
"logps/chosen": -370.125,
"logps/rejected": -513.4500122070312,
"loss": 0.0264,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.373773217201233,
"rewards/margins": 12.010156631469727,
"rewards/rejected": -13.376562118530273,
"step": 3990
},
{
"epoch": 1.7162321639309086,
"grad_norm": 15.018330304073203,
"learning_rate": 5.709227467811158e-07,
"logits/chosen": -0.9442383050918579,
"logits/rejected": -1.0,
"logps/chosen": -394.20001220703125,
"logps/rejected": -492.1000061035156,
"loss": 0.0157,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.021313428878784,
"rewards/margins": 11.879687309265137,
"rewards/rejected": -13.903905868530273,
"step": 4000
},
{
"epoch": 1.7205235489754318,
"grad_norm": 122.68808198378277,
"learning_rate": 5.698497854077253e-07,
"logits/chosen": -0.907177746295929,
"logits/rejected": -0.9401489496231079,
"logps/chosen": -370.54998779296875,
"logps/rejected": -454.57501220703125,
"loss": 0.051,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.528466820716858,
"rewards/margins": 11.520312309265137,
"rewards/rejected": -13.050000190734863,
"step": 4010
},
{
"epoch": 1.724814934019955,
"grad_norm": 0.4396574274383947,
"learning_rate": 5.687768240343346e-07,
"logits/chosen": -0.947509765625,
"logits/rejected": -0.9839843511581421,
"logps/chosen": -391.54998779296875,
"logps/rejected": -472.2250061035156,
"loss": 0.0231,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.2883422374725342,
"rewards/margins": 11.306249618530273,
"rewards/rejected": -12.596875190734863,
"step": 4020
},
{
"epoch": 1.7291063190644782,
"grad_norm": 26.73275191558095,
"learning_rate": 5.677038626609442e-07,
"logits/chosen": -0.9722656011581421,
"logits/rejected": -1.000341773033142,
"logps/chosen": -409.45001220703125,
"logps/rejected": -471.70001220703125,
"loss": 0.0404,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.661981225013733,
"rewards/margins": 11.647656440734863,
"rewards/rejected": -13.30859375,
"step": 4030
},
{
"epoch": 1.7333977041090012,
"grad_norm": 19.19872470819934,
"learning_rate": 5.666309012875537e-07,
"logits/chosen": -1.033203125,
"logits/rejected": -1.0773437023162842,
"logps/chosen": -358.5,
"logps/rejected": -469.75,
"loss": 0.0255,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.284204125404358,
"rewards/margins": 10.657031059265137,
"rewards/rejected": -11.944531440734863,
"step": 4040
},
{
"epoch": 1.7376890891535242,
"grad_norm": 1.3548188306470739,
"learning_rate": 5.655579399141631e-07,
"logits/chosen": -1.0725586414337158,
"logits/rejected": -1.125097632408142,
"logps/chosen": -421.2250061035156,
"logps/rejected": -485.6499938964844,
"loss": 0.0546,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.903643786907196,
"rewards/margins": 10.552343368530273,
"rewards/rejected": -11.461718559265137,
"step": 4050
},
{
"epoch": 1.7419804741980474,
"grad_norm": 2.8207139503507674,
"learning_rate": 5.644849785407725e-07,
"logits/chosen": -0.896472156047821,
"logits/rejected": -0.9592040777206421,
"logps/chosen": -353.0375061035156,
"logps/rejected": -467.29998779296875,
"loss": 0.0245,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.0071289539337158,
"rewards/margins": 11.774218559265137,
"rewards/rejected": -12.777734756469727,
"step": 4060
},
{
"epoch": 1.7462718592425706,
"grad_norm": 1.86076650332812,
"learning_rate": 5.634120171673819e-07,
"logits/chosen": -0.9498046636581421,
"logits/rejected": -0.9789062738418579,
"logps/chosen": -376.95001220703125,
"logps/rejected": -482.0249938964844,
"loss": 0.0653,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.7867920398712158,
"rewards/margins": 11.701562881469727,
"rewards/rejected": -13.493749618530273,
"step": 4070
},
{
"epoch": 1.7505632442870938,
"grad_norm": 3.286991435004404,
"learning_rate": 5.623390557939914e-07,
"logits/chosen": -1.005712866783142,
"logits/rejected": -1.0442383289337158,
"logps/chosen": -414.75,
"logps/rejected": -502.95001220703125,
"loss": 0.078,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.6180908679962158,
"rewards/margins": 12.618749618530273,
"rewards/rejected": -14.239062309265137,
"step": 4080
},
{
"epoch": 1.7548546293316167,
"grad_norm": 2.500263047383862,
"learning_rate": 5.612660944206008e-07,
"logits/chosen": -0.954516589641571,
"logits/rejected": -1.022070288658142,
"logps/chosen": -368.92498779296875,
"logps/rejected": -479.1000061035156,
"loss": 0.0418,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -1.1765015125274658,
"rewards/margins": 13.39453125,
"rewards/rejected": -14.567187309265137,
"step": 4090
},
{
"epoch": 1.75914601437614,
"grad_norm": 29.826078732562603,
"learning_rate": 5.601931330472103e-07,
"logits/chosen": -0.98291015625,
"logits/rejected": -0.9886718988418579,
"logps/chosen": -371.57501220703125,
"logps/rejected": -465.04998779296875,
"loss": 0.0271,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.32659912109375,
"rewards/margins": 11.499218940734863,
"rewards/rejected": -12.832812309265137,
"step": 4100
},
{
"epoch": 1.763437399420663,
"grad_norm": 46.447264070681186,
"learning_rate": 5.591201716738198e-07,
"logits/chosen": -0.9245361089706421,
"logits/rejected": -0.9839843511581421,
"logps/chosen": -362.2749938964844,
"logps/rejected": -447.6000061035156,
"loss": 0.0716,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.5927245616912842,
"rewards/margins": 11.297656059265137,
"rewards/rejected": -12.885156631469727,
"step": 4110
},
{
"epoch": 1.767728784465186,
"grad_norm": 5.575681277057093,
"learning_rate": 5.580472103004291e-07,
"logits/chosen": -0.874438464641571,
"logits/rejected": -0.939697265625,
"logps/chosen": -405.75,
"logps/rejected": -490.3999938964844,
"loss": 0.0468,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.0489501953125,
"rewards/margins": 11.47265625,
"rewards/rejected": -12.51953125,
"step": 4120
},
{
"epoch": 1.7720201695097093,
"grad_norm": 4.935040382025751,
"learning_rate": 5.569742489270386e-07,
"logits/chosen": -0.8921874761581421,
"logits/rejected": -0.8934081792831421,
"logps/chosen": -359.79998779296875,
"logps/rejected": -451.20001220703125,
"loss": 0.0474,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.152868628501892,
"rewards/margins": 11.1875,
"rewards/rejected": -12.335156440734863,
"step": 4130
},
{
"epoch": 1.7763115545542325,
"grad_norm": 0.5506212259709995,
"learning_rate": 5.559012875536481e-07,
"logits/chosen": -0.8636718988418579,
"logits/rejected": -0.9234863519668579,
"logps/chosen": -365.92498779296875,
"logps/rejected": -463.32501220703125,
"loss": 0.042,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.297882080078125,
"rewards/margins": 11.146093368530273,
"rewards/rejected": -12.446874618530273,
"step": 4140
},
{
"epoch": 1.7806029395987555,
"grad_norm": 49.99298736633369,
"learning_rate": 5.548283261802574e-07,
"logits/chosen": -1.000390648841858,
"logits/rejected": -1.0189208984375,
"logps/chosen": -345.0,
"logps/rejected": -493.0,
"loss": 0.0256,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.4110839366912842,
"rewards/margins": 12.52734375,
"rewards/rejected": -13.935937881469727,
"step": 4150
},
{
"epoch": 1.7848943246432785,
"grad_norm": 53.297165842946654,
"learning_rate": 5.537553648068669e-07,
"logits/chosen": -1.02392578125,
"logits/rejected": -1.0719726085662842,
"logps/chosen": -365.42498779296875,
"logps/rejected": -472.54998779296875,
"loss": 0.0625,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.6956055164337158,
"rewards/margins": 11.735156059265137,
"rewards/rejected": -13.427343368530273,
"step": 4160
},
{
"epoch": 1.7891857096878017,
"grad_norm": 80.7522111175801,
"learning_rate": 5.526824034334763e-07,
"logits/chosen": -1.0426757335662842,
"logits/rejected": -1.087158203125,
"logps/chosen": -398.6000061035156,
"logps/rejected": -478.875,
"loss": 0.0849,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -1.6728302240371704,
"rewards/margins": 10.279687881469727,
"rewards/rejected": -11.959375381469727,
"step": 4170
},
{
"epoch": 1.7934770947323249,
"grad_norm": 1.1018441662589793,
"learning_rate": 5.516094420600859e-07,
"logits/chosen": -0.9812988042831421,
"logits/rejected": -0.989453136920929,
"logps/chosen": -428.8500061035156,
"logps/rejected": -489.79998779296875,
"loss": 0.0142,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -1.0172851085662842,
"rewards/margins": 12.43359375,
"rewards/rejected": -13.443750381469727,
"step": 4180
},
{
"epoch": 1.797768479776848,
"grad_norm": 20.682326648490672,
"learning_rate": 5.505364806866953e-07,
"logits/chosen": -0.9356689453125,
"logits/rejected": -0.963574230670929,
"logps/chosen": -376.3125,
"logps/rejected": -464.9750061035156,
"loss": 0.0691,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.13818359375,
"rewards/margins": 11.571874618530273,
"rewards/rejected": -12.719531059265137,
"step": 4190
},
{
"epoch": 1.8020598648213713,
"grad_norm": 15.379090636705824,
"learning_rate": 5.494635193133047e-07,
"logits/chosen": -0.9769042730331421,
"logits/rejected": -1.007421851158142,
"logps/chosen": -361.82501220703125,
"logps/rejected": -473.3500061035156,
"loss": 0.0377,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.09783935546875,
"rewards/margins": 11.612500190734863,
"rewards/rejected": -12.715624809265137,
"step": 4200
},
{
"epoch": 1.8063512498658942,
"grad_norm": 52.329435507561556,
"learning_rate": 5.483905579399142e-07,
"logits/chosen": -0.890820324420929,
"logits/rejected": -0.906689465045929,
"logps/chosen": -368.79998779296875,
"logps/rejected": -457.2250061035156,
"loss": 0.0449,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.0990631580352783,
"rewards/margins": 11.224218368530273,
"rewards/rejected": -12.311718940734863,
"step": 4210
},
{
"epoch": 1.8106426349104172,
"grad_norm": 158.0503270116596,
"learning_rate": 5.473175965665235e-07,
"logits/chosen": -0.909716784954071,
"logits/rejected": -0.9754638671875,
"logps/chosen": -381.9125061035156,
"logps/rejected": -447.86248779296875,
"loss": 0.0552,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.0349609851837158,
"rewards/margins": 11.165624618530273,
"rewards/rejected": -12.204687118530273,
"step": 4220
},
{
"epoch": 1.8149340199549404,
"grad_norm": 23.085347892645842,
"learning_rate": 5.46244635193133e-07,
"logits/chosen": -0.9601806402206421,
"logits/rejected": -0.9806152582168579,
"logps/chosen": -381.38751220703125,
"logps/rejected": -460.0249938964844,
"loss": 0.0516,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.6144530773162842,
"rewards/margins": 11.489062309265137,
"rewards/rejected": -13.094531059265137,
"step": 4230
},
{
"epoch": 1.8192254049994636,
"grad_norm": 0.639237582939514,
"learning_rate": 5.451716738197425e-07,
"logits/chosen": -0.9354492425918579,
"logits/rejected": -0.983105480670929,
"logps/chosen": -378.01251220703125,
"logps/rejected": -445.8500061035156,
"loss": 0.035,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.6176636219024658,
"rewards/margins": 12.065625190734863,
"rewards/rejected": -13.68359375,
"step": 4240
},
{
"epoch": 1.8235167900439868,
"grad_norm": 9.146186731241539,
"learning_rate": 5.440987124463518e-07,
"logits/chosen": -0.9319823980331421,
"logits/rejected": -0.9876464605331421,
"logps/chosen": -380.2749938964844,
"logps/rejected": -500.3999938964844,
"loss": 0.0651,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.169995069503784,
"rewards/margins": 12.806249618530273,
"rewards/rejected": -14.9765625,
"step": 4250
},
{
"epoch": 1.8278081750885098,
"grad_norm": 51.85960284001404,
"learning_rate": 5.430257510729614e-07,
"logits/chosen": -0.9583984613418579,
"logits/rejected": -0.996142566204071,
"logps/chosen": -376.13751220703125,
"logps/rejected": -488.6499938964844,
"loss": 0.0546,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.7899901866912842,
"rewards/margins": 13.244531631469727,
"rewards/rejected": -15.040624618530273,
"step": 4260
},
{
"epoch": 1.832099560133033,
"grad_norm": 10.827144951742474,
"learning_rate": 5.419527896995708e-07,
"logits/chosen": -0.955761730670929,
"logits/rejected": -1.014550805091858,
"logps/chosen": -384.61248779296875,
"logps/rejected": -473.20001220703125,
"loss": 0.0168,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -1.629003882408142,
"rewards/margins": 12.381250381469727,
"rewards/rejected": -14.006250381469727,
"step": 4270
},
{
"epoch": 1.836390945177556,
"grad_norm": 3.245345263573117,
"learning_rate": 5.408798283261803e-07,
"logits/chosen": -0.989245593547821,
"logits/rejected": -1.0054931640625,
"logps/chosen": -362.4750061035156,
"logps/rejected": -434.79998779296875,
"loss": 0.0464,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.1982178688049316,
"rewards/margins": 10.431249618530273,
"rewards/rejected": -12.629687309265137,
"step": 4280
},
{
"epoch": 1.8406823302220792,
"grad_norm": 10.487556838008045,
"learning_rate": 5.398068669527897e-07,
"logits/chosen": -0.935302734375,
"logits/rejected": -0.9648193120956421,
"logps/chosen": -410.6000061035156,
"logps/rejected": -499.6000061035156,
"loss": 0.0371,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.293371558189392,
"rewards/margins": 12.314844131469727,
"rewards/rejected": -13.608593940734863,
"step": 4290
},
{
"epoch": 1.8449737152666024,
"grad_norm": 18.537853125563366,
"learning_rate": 5.387339055793991e-07,
"logits/chosen": -0.972973644733429,
"logits/rejected": -0.996337890625,
"logps/chosen": -399.29998779296875,
"logps/rejected": -497.6499938964844,
"loss": 0.0357,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.343481421470642,
"rewards/margins": 12.47265625,
"rewards/rejected": -13.809374809265137,
"step": 4300
},
{
"epoch": 1.8492651003111256,
"grad_norm": 153.06839854682727,
"learning_rate": 5.376609442060086e-07,
"logits/chosen": -0.8988037109375,
"logits/rejected": -0.92950439453125,
"logps/chosen": -404.375,
"logps/rejected": -467.1499938964844,
"loss": 0.0655,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.0414550304412842,
"rewards/margins": 11.288281440734863,
"rewards/rejected": -12.322656631469727,
"step": 4310
},
{
"epoch": 1.8535564853556485,
"grad_norm": 27.06877025444218,
"learning_rate": 5.365879828326179e-07,
"logits/chosen": -0.9356933832168579,
"logits/rejected": -0.9637206792831421,
"logps/chosen": -369.78125,
"logps/rejected": -456.79998779296875,
"loss": 0.0597,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.0084471702575684,
"rewards/margins": 10.43359375,
"rewards/rejected": -12.454687118530273,
"step": 4320
},
{
"epoch": 1.8578478704001715,
"grad_norm": 4.310579860258788,
"learning_rate": 5.355150214592274e-07,
"logits/chosen": -0.849682629108429,
"logits/rejected": -0.8754638433456421,
"logps/chosen": -372.0249938964844,
"logps/rejected": -495.25,
"loss": 0.0687,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.2420165538787842,
"rewards/margins": 12.567187309265137,
"rewards/rejected": -13.809374809265137,
"step": 4330
},
{
"epoch": 1.8621392554446947,
"grad_norm": 10.135312676352479,
"learning_rate": 5.34442060085837e-07,
"logits/chosen": -0.9974609613418579,
"logits/rejected": -1.062475562095642,
"logps/chosen": -348.67498779296875,
"logps/rejected": -440.3500061035156,
"loss": 0.053,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.0508790016174316,
"rewards/margins": 11.01953125,
"rewards/rejected": -13.072656631469727,
"step": 4340
},
{
"epoch": 1.866430640489218,
"grad_norm": 36.928863505563584,
"learning_rate": 5.333690987124463e-07,
"logits/chosen": -0.9471191167831421,
"logits/rejected": -0.977783203125,
"logps/chosen": -384.7250061035156,
"logps/rejected": -516.2999877929688,
"loss": 0.0308,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.8770020008087158,
"rewards/margins": 12.849218368530273,
"rewards/rejected": -14.7265625,
"step": 4350
},
{
"epoch": 1.8707220255337411,
"grad_norm": 0.4141237719958023,
"learning_rate": 5.322961373390558e-07,
"logits/chosen": -0.913818359375,
"logits/rejected": -0.9593750238418579,
"logps/chosen": -373.9125061035156,
"logps/rejected": -487.375,
"loss": 0.0333,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.8375732898712158,
"rewards/margins": 11.971094131469727,
"rewards/rejected": -13.809374809265137,
"step": 4360
},
{
"epoch": 1.875013410578264,
"grad_norm": 56.450189376473574,
"learning_rate": 5.312231759656652e-07,
"logits/chosen": -1.008691430091858,
"logits/rejected": -1.0224609375,
"logps/chosen": -385.95001220703125,
"logps/rejected": -460.79998779296875,
"loss": 0.041,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.0730834007263184,
"rewards/margins": 12.158594131469727,
"rewards/rejected": -14.232030868530273,
"step": 4370
},
{
"epoch": 1.8793047956227873,
"grad_norm": 9.54783905701276,
"learning_rate": 5.301502145922746e-07,
"logits/chosen": -0.8971191644668579,
"logits/rejected": -0.9556640386581421,
"logps/chosen": -413.9750061035156,
"logps/rejected": -502.32501220703125,
"loss": 0.0272,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.6408447027206421,
"rewards/margins": 12.224218368530273,
"rewards/rejected": -12.864843368530273,
"step": 4380
},
{
"epoch": 1.8835961806673103,
"grad_norm": 182.77364675505413,
"learning_rate": 5.290772532188841e-07,
"logits/chosen": -0.9560546875,
"logits/rejected": -0.9826904535293579,
"logps/chosen": -392.4750061035156,
"logps/rejected": -480.5,
"loss": 0.0504,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.87359619140625,
"rewards/margins": 10.739062309265137,
"rewards/rejected": -12.615625381469727,
"step": 4390
},
{
"epoch": 1.8878875657118335,
"grad_norm": 20.390810817068484,
"learning_rate": 5.280042918454935e-07,
"logits/chosen": -0.83056640625,
"logits/rejected": -0.853564441204071,
"logps/chosen": -348.23126220703125,
"logps/rejected": -479.79998779296875,
"loss": 0.0394,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.3259766101837158,
"rewards/margins": 12.457812309265137,
"rewards/rejected": -13.792187690734863,
"step": 4400
},
{
"epoch": 1.8921789507563567,
"grad_norm": 15.337774109502499,
"learning_rate": 5.26931330472103e-07,
"logits/chosen": -0.859326183795929,
"logits/rejected": -0.894482433795929,
"logps/chosen": -384.23748779296875,
"logps/rejected": -491.2250061035156,
"loss": 0.0464,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.2955565452575684,
"rewards/margins": 11.717187881469727,
"rewards/rejected": -14.010937690734863,
"step": 4410
},
{
"epoch": 1.8964703358008799,
"grad_norm": 2.265968307575372,
"learning_rate": 5.258583690987124e-07,
"logits/chosen": -0.9061034917831421,
"logits/rejected": -0.9704345464706421,
"logps/chosen": -355.1499938964844,
"logps/rejected": -474.125,
"loss": 0.0127,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.347851514816284,
"rewards/margins": 11.787500381469727,
"rewards/rejected": -14.135937690734863,
"step": 4420
},
{
"epoch": 1.9007617208454028,
"grad_norm": 32.705082452578196,
"learning_rate": 5.247854077253219e-07,
"logits/chosen": -0.835253894329071,
"logits/rejected": -0.8897949457168579,
"logps/chosen": -373.875,
"logps/rejected": -454.67498779296875,
"loss": 0.079,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.26690673828125,
"rewards/margins": 11.690625190734863,
"rewards/rejected": -13.959375381469727,
"step": 4430
},
{
"epoch": 1.9050531058899258,
"grad_norm": 46.704049108499824,
"learning_rate": 5.237124463519314e-07,
"logits/chosen": -0.892626941204071,
"logits/rejected": -0.9200439453125,
"logps/chosen": -360.875,
"logps/rejected": -448.29998779296875,
"loss": 0.1067,
"rewards/accuracies": 0.9375,
"rewards/chosen": -1.8506591320037842,
"rewards/margins": 11.145312309265137,
"rewards/rejected": -12.996874809265137,
"step": 4440
},
{
"epoch": 1.909344490934449,
"grad_norm": 3.7170229703324456,
"learning_rate": 5.226394849785407e-07,
"logits/chosen": -0.91796875,
"logits/rejected": -0.937060534954071,
"logps/chosen": -381.0,
"logps/rejected": -479.1000061035156,
"loss": 0.0612,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.321240186691284,
"rewards/margins": 11.30078125,
"rewards/rejected": -13.6171875,
"step": 4450
},
{
"epoch": 1.9136358759789722,
"grad_norm": 3.153634344334266,
"learning_rate": 5.215665236051502e-07,
"logits/chosen": -0.9183105230331421,
"logits/rejected": -0.9302978515625,
"logps/chosen": -371.17498779296875,
"logps/rejected": -504.3500061035156,
"loss": 0.0337,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.168798804283142,
"rewards/margins": 12.172266006469727,
"rewards/rejected": -13.350781440734863,
"step": 4460
},
{
"epoch": 1.9179272610234954,
"grad_norm": 41.25008649238425,
"learning_rate": 5.204935622317596e-07,
"logits/chosen": -0.8514648675918579,
"logits/rejected": -0.9063965082168579,
"logps/chosen": -392.125,
"logps/rejected": -449.70001220703125,
"loss": 0.0424,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.37053221464157104,
"rewards/margins": 11.278124809265137,
"rewards/rejected": -11.649999618530273,
"step": 4470
},
{
"epoch": 1.9222186460680184,
"grad_norm": 20.23026179444304,
"learning_rate": 5.19420600858369e-07,
"logits/chosen": -0.890380859375,
"logits/rejected": -0.947509765625,
"logps/chosen": -388.75,
"logps/rejected": -474.25,
"loss": 0.054,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.42601317167282104,
"rewards/margins": 11.646875381469727,
"rewards/rejected": -12.080469131469727,
"step": 4480
},
{
"epoch": 1.9265100311125416,
"grad_norm": 1.3408718104792696,
"learning_rate": 5.183476394849786e-07,
"logits/chosen": -0.913647472858429,
"logits/rejected": -0.9691406488418579,
"logps/chosen": -397.07501220703125,
"logps/rejected": -463.54998779296875,
"loss": 0.0443,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.03182373195886612,
"rewards/margins": 12.149999618530273,
"rewards/rejected": -12.184765815734863,
"step": 4490
},
{
"epoch": 1.9308014161570646,
"grad_norm": 53.11739706779699,
"learning_rate": 5.17274678111588e-07,
"logits/chosen": -0.913134753704071,
"logits/rejected": -0.930957019329071,
"logps/chosen": -394.70001220703125,
"logps/rejected": -491.95001220703125,
"loss": 0.057,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.619213879108429,
"rewards/margins": 12.110156059265137,
"rewards/rejected": -12.73046875,
"step": 4500
},
{
"epoch": 1.9350928012015878,
"grad_norm": 2.944999759554218,
"learning_rate": 5.162017167381975e-07,
"logits/chosen": -1.0154297351837158,
"logits/rejected": -1.0544922351837158,
"logps/chosen": -347.7250061035156,
"logps/rejected": -461.5,
"loss": 0.0699,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.9320068359375,
"rewards/margins": 12.104296684265137,
"rewards/rejected": -13.038281440734863,
"step": 4510
},
{
"epoch": 1.939384186246111,
"grad_norm": 44.9848920404682,
"learning_rate": 5.151287553648068e-07,
"logits/chosen": -0.966625988483429,
"logits/rejected": -0.982177734375,
"logps/chosen": -353.8500061035156,
"logps/rejected": -448.95001220703125,
"loss": 0.0719,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.562841773033142,
"rewards/margins": 10.638280868530273,
"rewards/rejected": -12.199999809265137,
"step": 4520
},
{
"epoch": 1.9436755712906342,
"grad_norm": 2.4273690078595576,
"learning_rate": 5.140557939914163e-07,
"logits/chosen": -0.930004894733429,
"logits/rejected": -0.971606433391571,
"logps/chosen": -385.17498779296875,
"logps/rejected": -453.0,
"loss": 0.0359,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.6266112327575684,
"rewards/margins": 11.353124618530273,
"rewards/rejected": -13.970312118530273,
"step": 4530
},
{
"epoch": 1.9479669563351572,
"grad_norm": 0.563126903276404,
"learning_rate": 5.129828326180258e-07,
"logits/chosen": -0.9853515625,
"logits/rejected": -1.020410180091858,
"logps/chosen": -380.9750061035156,
"logps/rejected": -449.375,
"loss": 0.0585,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.808874487876892,
"rewards/margins": 12.053125381469727,
"rewards/rejected": -13.865625381469727,
"step": 4540
},
{
"epoch": 1.9522583413796801,
"grad_norm": 70.01156196901671,
"learning_rate": 5.119098712446351e-07,
"logits/chosen": -0.983105480670929,
"logits/rejected": -1.0392272472381592,
"logps/chosen": -354.8125,
"logps/rejected": -465.32501220703125,
"loss": 0.0366,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.0246825218200684,
"rewards/margins": 11.590624809265137,
"rewards/rejected": -13.615625381469727,
"step": 4550
},
{
"epoch": 1.9565497264242033,
"grad_norm": 96.2369459024813,
"learning_rate": 5.108369098712446e-07,
"logits/chosen": -1.011962890625,
"logits/rejected": -1.036596655845642,
"logps/chosen": -365.82501220703125,
"logps/rejected": -493.6000061035156,
"loss": 0.0822,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.084564208984375,
"rewards/margins": 11.507031440734863,
"rewards/rejected": -13.598437309265137,
"step": 4560
},
{
"epoch": 1.9608411114687265,
"grad_norm": 5.208717013449673,
"learning_rate": 5.09763948497854e-07,
"logits/chosen": -0.9501708745956421,
"logits/rejected": -0.993847668170929,
"logps/chosen": -339.9125061035156,
"logps/rejected": -462.2749938964844,
"loss": 0.0325,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.009857177734375,
"rewards/margins": 11.40625,
"rewards/rejected": -13.421093940734863,
"step": 4570
},
{
"epoch": 1.9651324965132497,
"grad_norm": 0.8034446024792199,
"learning_rate": 5.086909871244635e-07,
"logits/chosen": -0.998779296875,
"logits/rejected": -1.0099608898162842,
"logps/chosen": -392.20001220703125,
"logps/rejected": -483.17498779296875,
"loss": 0.0594,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.5322265625,
"rewards/margins": 11.840624809265137,
"rewards/rejected": -13.367968559265137,
"step": 4580
},
{
"epoch": 1.969423881557773,
"grad_norm": 4.328983885472126,
"learning_rate": 5.07618025751073e-07,
"logits/chosen": -0.982617199420929,
"logits/rejected": -1.0090820789337158,
"logps/chosen": -441.17498779296875,
"logps/rejected": -502.9750061035156,
"loss": 0.0302,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.317587375640869,
"rewards/margins": 12.170702934265137,
"rewards/rejected": -14.484375,
"step": 4590
},
{
"epoch": 1.973715266602296,
"grad_norm": 27.71457389608174,
"learning_rate": 5.065450643776824e-07,
"logits/chosen": -1.0812499523162842,
"logits/rejected": -1.1186034679412842,
"logps/chosen": -413.375,
"logps/rejected": -475.6499938964844,
"loss": 0.0504,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.806396484375,
"rewards/margins": 11.99609375,
"rewards/rejected": -13.814062118530273,
"step": 4600
},
{
"epoch": 1.9780066516468189,
"grad_norm": 47.444585000623135,
"learning_rate": 5.054721030042918e-07,
"logits/chosen": -0.9796386957168579,
"logits/rejected": -1.038671851158142,
"logps/chosen": -400.9750061035156,
"logps/rejected": -486.29998779296875,
"loss": 0.0708,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.5377440452575684,
"rewards/margins": 12.588281631469727,
"rewards/rejected": -15.128125190734863,
"step": 4610
},
{
"epoch": 1.982298036691342,
"grad_norm": 1.710670740867975,
"learning_rate": 5.043991416309012e-07,
"logits/chosen": -0.931591808795929,
"logits/rejected": -0.978710949420929,
"logps/chosen": -395.42498779296875,
"logps/rejected": -472.07501220703125,
"loss": 0.0716,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.3408629894256592,
"rewards/margins": 12.425390243530273,
"rewards/rejected": -13.76953125,
"step": 4620
},
{
"epoch": 1.9865894217358653,
"grad_norm": 90.63523783921438,
"learning_rate": 5.033261802575107e-07,
"logits/chosen": -0.903759777545929,
"logits/rejected": -0.9393340945243835,
"logps/chosen": -399.6000061035156,
"logps/rejected": -520.0750122070312,
"loss": 0.0275,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.478979468345642,
"rewards/margins": 13.239843368530273,
"rewards/rejected": -14.727343559265137,
"step": 4630
},
{
"epoch": 1.9908808067803885,
"grad_norm": 30.711067654319294,
"learning_rate": 5.022532188841202e-07,
"logits/chosen": -0.8616698980331421,
"logits/rejected": -0.9175781011581421,
"logps/chosen": -388.2875061035156,
"logps/rejected": -472.42498779296875,
"loss": 0.0317,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.0430176258087158,
"rewards/margins": 12.157812118530273,
"rewards/rejected": -13.208593368530273,
"step": 4640
},
{
"epoch": 1.9951721918249115,
"grad_norm": 0.3829447074715143,
"learning_rate": 5.011802575107296e-07,
"logits/chosen": -0.959277331829071,
"logits/rejected": -1.0222656726837158,
"logps/chosen": -396.8999938964844,
"logps/rejected": -496.54998779296875,
"loss": 0.0585,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.042028784751892,
"rewards/margins": 12.974218368530273,
"rewards/rejected": -14.018750190734863,
"step": 4650
},
{
"epoch": 1.9994635768694347,
"grad_norm": 41.67127946798679,
"learning_rate": 5.001072961373391e-07,
"logits/chosen": -0.886279284954071,
"logits/rejected": -0.9300781488418579,
"logps/chosen": -347.3125,
"logps/rejected": -449.25,
"loss": 0.0342,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.505346655845642,
"rewards/margins": 11.438281059265137,
"rewards/rejected": -12.946874618530273,
"step": 4660
},
{
"epoch": 2.0034331080356185,
"grad_norm": 0.027779198802832493,
"learning_rate": 4.990343347639485e-07,
"logits/chosen": -0.9422508478164673,
"logits/rejected": -0.962890625,
"logps/chosen": -377.70269775390625,
"logps/rejected": -489.1351318359375,
"loss": 0.0216,
"rewards/accuracies": 0.9797297120094299,
"rewards/chosen": -0.5486037731170654,
"rewards/margins": 13.966216087341309,
"rewards/rejected": -14.513513565063477,
"step": 4670
},
{
"epoch": 2.0077244930801417,
"grad_norm": 0.058596251501053756,
"learning_rate": 4.979613733905579e-07,
"logits/chosen": -0.9541015625,
"logits/rejected": -0.979443371295929,
"logps/chosen": -383.4750061035156,
"logps/rejected": -476.6000061035156,
"loss": 0.0132,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -1.5182373523712158,
"rewards/margins": 13.623437881469727,
"rewards/rejected": -15.140625,
"step": 4680
},
{
"epoch": 2.012015878124665,
"grad_norm": 0.08219661419120212,
"learning_rate": 4.968884120171674e-07,
"logits/chosen": -0.985546886920929,
"logits/rejected": -1.0363280773162842,
"logps/chosen": -419.82501220703125,
"logps/rejected": -545.5499877929688,
"loss": 0.0004,
"rewards/accuracies": 1.0,
"rewards/chosen": -1.5763061046600342,
"rewards/margins": 15.018750190734863,
"rewards/rejected": -16.584375381469727,
"step": 4690
},
{
"epoch": 2.016307263169188,
"grad_norm": 1.6454054767946809,
"learning_rate": 4.958154506437768e-07,
"logits/chosen": -0.954028308391571,
"logits/rejected": -1.0149657726287842,
"logps/chosen": -411.4375,
"logps/rejected": -562.375,
"loss": 0.0121,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.0797362327575684,
"rewards/margins": 16.078907012939453,
"rewards/rejected": -18.160938262939453,
"step": 4700
},
{
"epoch": 2.020598648213711,
"grad_norm": 0.14648838332714317,
"learning_rate": 4.947424892703862e-07,
"logits/chosen": -0.9322265386581421,
"logits/rejected": -0.9351562261581421,
"logps/chosen": -367.88751220703125,
"logps/rejected": -512.5250244140625,
"loss": 0.0133,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.308837890625,
"rewards/margins": 16.378124237060547,
"rewards/rejected": -18.676563262939453,
"step": 4710
},
{
"epoch": 2.024890033258234,
"grad_norm": 0.6465582591461517,
"learning_rate": 4.936695278969956e-07,
"logits/chosen": -0.9916015863418579,
"logits/rejected": -1.0476562976837158,
"logps/chosen": -438.875,
"logps/rejected": -554.5999755859375,
"loss": 0.0082,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.7232422828674316,
"rewards/margins": 15.8359375,
"rewards/rejected": -18.568750381469727,
"step": 4720
},
{
"epoch": 2.0291814183027572,
"grad_norm": 0.3091010197952818,
"learning_rate": 4.925965665236052e-07,
"logits/chosen": -0.8946288824081421,
"logits/rejected": -0.9400390386581421,
"logps/chosen": -411.75,
"logps/rejected": -561.25,
"loss": 0.0242,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.6024413108825684,
"rewards/margins": 16.043750762939453,
"rewards/rejected": -18.659374237060547,
"step": 4730
},
{
"epoch": 2.0334728033472804,
"grad_norm": 2.768302372276932,
"learning_rate": 4.915236051502146e-07,
"logits/chosen": -0.9747680425643921,
"logits/rejected": -1.01904296875,
"logps/chosen": -323.54998779296875,
"logps/rejected": -495.8999938964844,
"loss": 0.0136,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.592260718345642,
"rewards/margins": 15.161718368530273,
"rewards/rejected": -16.748437881469727,
"step": 4740
},
{
"epoch": 2.0377641883918036,
"grad_norm": 0.9396057921861978,
"learning_rate": 4.90450643776824e-07,
"logits/chosen": -0.9452148675918579,
"logits/rejected": -0.968579113483429,
"logps/chosen": -371.375,
"logps/rejected": -514.5,
"loss": 0.0064,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.461010694503784,
"rewards/margins": 14.9296875,
"rewards/rejected": -17.3984375,
"step": 4750
},
{
"epoch": 2.0420555734363264,
"grad_norm": 1.3859603812649923,
"learning_rate": 4.893776824034335e-07,
"logits/chosen": -1.015234351158142,
"logits/rejected": -1.0478026866912842,
"logps/chosen": -363.04998779296875,
"logps/rejected": -488.4750061035156,
"loss": 0.0086,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.0025877952575684,
"rewards/margins": 15.129687309265137,
"rewards/rejected": -17.135936737060547,
"step": 4760
},
{
"epoch": 2.0463469584808496,
"grad_norm": 0.009066003312516537,
"learning_rate": 4.883047210300429e-07,
"logits/chosen": -1.040869116783142,
"logits/rejected": -1.0402100086212158,
"logps/chosen": -383.125,
"logps/rejected": -523.0999755859375,
"loss": 0.0098,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.7064208984375,
"rewards/margins": 15.251562118530273,
"rewards/rejected": -17.9375,
"step": 4770
},
{
"epoch": 2.0506383435253728,
"grad_norm": 0.1620939336388554,
"learning_rate": 4.872317596566523e-07,
"logits/chosen": -1.003271460533142,
"logits/rejected": -1.0250976085662842,
"logps/chosen": -364.5249938964844,
"logps/rejected": -512.9500122070312,
"loss": 0.011,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.374316453933716,
"rewards/margins": 15.456250190734863,
"rewards/rejected": -18.8359375,
"step": 4780
},
{
"epoch": 2.054929728569896,
"grad_norm": 10.107963912563209,
"learning_rate": 4.861587982832618e-07,
"logits/chosen": -1.0659668445587158,
"logits/rejected": -1.1134765148162842,
"logps/chosen": -382.70001220703125,
"logps/rejected": -531.9749755859375,
"loss": 0.0054,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.9286742210388184,
"rewards/margins": 15.485937118530273,
"rewards/rejected": -18.424999237060547,
"step": 4790
},
{
"epoch": 2.059221113614419,
"grad_norm": 0.12108622323493068,
"learning_rate": 4.850858369098712e-07,
"logits/chosen": -0.99560546875,
"logits/rejected": -1.0546875,
"logps/chosen": -365.625,
"logps/rejected": -497.04998779296875,
"loss": 0.0108,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.7535157203674316,
"rewards/margins": 15.518750190734863,
"rewards/rejected": -19.270313262939453,
"step": 4800
},
{
"epoch": 2.0635124986589424,
"grad_norm": 0.6044017396242726,
"learning_rate": 4.840128755364807e-07,
"logits/chosen": -1.090429663658142,
"logits/rejected": -1.139746069908142,
"logps/chosen": -378.4750061035156,
"logps/rejected": -505.17498779296875,
"loss": 0.0257,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.446582078933716,
"rewards/margins": 16.165624618530273,
"rewards/rejected": -19.604686737060547,
"step": 4810
},
{
"epoch": 2.067803883703465,
"grad_norm": 4.8369341786667635,
"learning_rate": 4.829399141630901e-07,
"logits/chosen": -1.0584716796875,
"logits/rejected": -1.1092529296875,
"logps/chosen": -381.9750061035156,
"logps/rejected": -534.6500244140625,
"loss": 0.0058,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.72216796875,
"rewards/margins": 15.753125190734863,
"rewards/rejected": -19.487499237060547,
"step": 4820
},
{
"epoch": 2.0720952687479883,
"grad_norm": 0.5817973223502714,
"learning_rate": 4.818669527896996e-07,
"logits/chosen": -0.994000256061554,
"logits/rejected": -1.0557861328125,
"logps/chosen": -393.0,
"logps/rejected": -497.6000061035156,
"loss": 0.0061,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.760449171066284,
"rewards/margins": 14.862500190734863,
"rewards/rejected": -18.615625381469727,
"step": 4830
},
{
"epoch": 2.0763866537925115,
"grad_norm": 0.056653641243303195,
"learning_rate": 4.80793991416309e-07,
"logits/chosen": -1.0192382335662842,
"logits/rejected": -1.075781226158142,
"logps/chosen": -387.3999938964844,
"logps/rejected": -539.25,
"loss": 0.0116,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.884777784347534,
"rewards/margins": 16.787500381469727,
"rewards/rejected": -20.673437118530273,
"step": 4840
},
{
"epoch": 2.0806780388370347,
"grad_norm": 0.17191243721182908,
"learning_rate": 4.797210300429184e-07,
"logits/chosen": -1.0615234375,
"logits/rejected": -1.1252930164337158,
"logps/chosen": -362.875,
"logps/rejected": -514.9500122070312,
"loss": 0.0113,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.2962889671325684,
"rewards/margins": 16.417186737060547,
"rewards/rejected": -19.709375381469727,
"step": 4850
},
{
"epoch": 2.084969423881558,
"grad_norm": 0.19566869513875954,
"learning_rate": 4.786480686695279e-07,
"logits/chosen": -1.043701171875,
"logits/rejected": -1.080322265625,
"logps/chosen": -386.67498779296875,
"logps/rejected": -515.0,
"loss": 0.0064,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.559497117996216,
"rewards/margins": 16.100000381469727,
"rewards/rejected": -19.668750762939453,
"step": 4860
},
{
"epoch": 2.0892608089260807,
"grad_norm": 0.35072865560749955,
"learning_rate": 4.775751072961373e-07,
"logits/chosen": -1.0676758289337158,
"logits/rejected": -1.09375,
"logps/chosen": -384.625,
"logps/rejected": -528.6500244140625,
"loss": 0.022,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.4744873046875,
"rewards/margins": 16.159374237060547,
"rewards/rejected": -19.626562118530273,
"step": 4870
},
{
"epoch": 2.093552193970604,
"grad_norm": 0.07825584574057835,
"learning_rate": 4.7650214592274674e-07,
"logits/chosen": -1.0342528820037842,
"logits/rejected": -1.1032226085662842,
"logps/chosen": -388.5375061035156,
"logps/rejected": -513.7750244140625,
"loss": 0.0136,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.6719727516174316,
"rewards/margins": 16.390625,
"rewards/rejected": -19.065624237060547,
"step": 4880
},
{
"epoch": 2.097843579015127,
"grad_norm": 0.16214672396271004,
"learning_rate": 4.754291845493562e-07,
"logits/chosen": -0.9888671636581421,
"logits/rejected": -1.033544898033142,
"logps/chosen": -379.45001220703125,
"logps/rejected": -511.54998779296875,
"loss": 0.011,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.792724609375,
"rewards/margins": 16.501562118530273,
"rewards/rejected": -19.293750762939453,
"step": 4890
},
{
"epoch": 2.1021349640596503,
"grad_norm": 2.293165816140267,
"learning_rate": 4.743562231759656e-07,
"logits/chosen": -0.9765380620956421,
"logits/rejected": -1.0322265625,
"logps/chosen": -395.6499938964844,
"logps/rejected": -535.5499877929688,
"loss": 0.0278,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.7255616188049316,
"rewards/margins": 15.540624618530273,
"rewards/rejected": -19.267187118530273,
"step": 4900
},
{
"epoch": 2.1064263491041735,
"grad_norm": 0.0350920407522629,
"learning_rate": 4.732832618025751e-07,
"logits/chosen": -1.08203125,
"logits/rejected": -1.118261694908142,
"logps/chosen": -395.5249938964844,
"logps/rejected": -561.7999877929688,
"loss": 0.0094,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.230554103851318,
"rewards/margins": 17.887500762939453,
"rewards/rejected": -22.103124618530273,
"step": 4910
},
{
"epoch": 2.1107177341486967,
"grad_norm": 1.3768287495370228,
"learning_rate": 4.7221030042918455e-07,
"logits/chosen": -1.1409180164337158,
"logits/rejected": -1.157128930091858,
"logps/chosen": -386.45001220703125,
"logps/rejected": -521.7000122070312,
"loss": 0.0062,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.490136623382568,
"rewards/margins": 15.6640625,
"rewards/rejected": -20.142187118530273,
"step": 4920
},
{
"epoch": 2.1150091191932194,
"grad_norm": 14.770899356614224,
"learning_rate": 4.7113733905579396e-07,
"logits/chosen": -1.069970726966858,
"logits/rejected": -1.1149413585662842,
"logps/chosen": -421.54998779296875,
"logps/rejected": -579.8499755859375,
"loss": 0.0062,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.514746189117432,
"rewards/margins": 16.623437881469727,
"rewards/rejected": -21.134374618530273,
"step": 4930
},
{
"epoch": 2.1193005042377426,
"grad_norm": 0.05859768547809522,
"learning_rate": 4.700643776824034e-07,
"logits/chosen": -1.067480444908142,
"logits/rejected": -1.104589819908142,
"logps/chosen": -404.45001220703125,
"logps/rejected": -542.9000244140625,
"loss": 0.0047,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.472973585128784,
"rewards/margins": 17.254688262939453,
"rewards/rejected": -20.729686737060547,
"step": 4940
},
{
"epoch": 2.123591889282266,
"grad_norm": 0.1989401785399322,
"learning_rate": 4.6899141630901283e-07,
"logits/chosen": -1.057226538658142,
"logits/rejected": -1.135473608970642,
"logps/chosen": -408.67498779296875,
"logps/rejected": -546.5999755859375,
"loss": 0.0113,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.691210985183716,
"rewards/margins": 15.300000190734863,
"rewards/rejected": -18.989063262939453,
"step": 4950
},
{
"epoch": 2.127883274326789,
"grad_norm": 0.721478379214845,
"learning_rate": 4.679184549356223e-07,
"logits/chosen": -0.971240222454071,
"logits/rejected": -1.0159423351287842,
"logps/chosen": -373.375,
"logps/rejected": -529.9000244140625,
"loss": 0.0344,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -3.3294434547424316,
"rewards/margins": 15.7265625,
"rewards/rejected": -19.065624237060547,
"step": 4960
},
{
"epoch": 2.1321746593713122,
"grad_norm": 0.6134904165378215,
"learning_rate": 4.6684549356223176e-07,
"logits/chosen": -1.086328148841858,
"logits/rejected": -1.100341796875,
"logps/chosen": -390.07501220703125,
"logps/rejected": -495.04998779296875,
"loss": 0.0208,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.837127685546875,
"rewards/margins": 14.7734375,
"rewards/rejected": -17.604686737060547,
"step": 4970
},
{
"epoch": 2.136466044415835,
"grad_norm": 0.17165449036213082,
"learning_rate": 4.6577253218884117e-07,
"logits/chosen": -0.9689697027206421,
"logits/rejected": -0.9990234375,
"logps/chosen": -393.5249938964844,
"logps/rejected": -532.2999877929688,
"loss": 0.0175,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.0843505859375,
"rewards/margins": 16.454687118530273,
"rewards/rejected": -19.535938262939453,
"step": 4980
},
{
"epoch": 2.140757429460358,
"grad_norm": 10.715440711865096,
"learning_rate": 4.6469957081545064e-07,
"logits/chosen": -0.990234375,
"logits/rejected": -1.05419921875,
"logps/chosen": -400.1499938964844,
"logps/rejected": -514.0999755859375,
"loss": 0.0118,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.9560546875,
"rewards/margins": 14.573437690734863,
"rewards/rejected": -17.526561737060547,
"step": 4990
},
{
"epoch": 2.1450488145048814,
"grad_norm": 0.21734046220221115,
"learning_rate": 4.6362660944206005e-07,
"logits/chosen": -1.0558593273162842,
"logits/rejected": -1.113867163658142,
"logps/chosen": -396.3500061035156,
"logps/rejected": -535.2999877929688,
"loss": 0.009,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.804003953933716,
"rewards/margins": 15.469531059265137,
"rewards/rejected": -18.270313262939453,
"step": 5000
},
{
"epoch": 2.1493401995494046,
"grad_norm": 0.07366536026877506,
"learning_rate": 4.625536480686695e-07,
"logits/chosen": -1.0662109851837158,
"logits/rejected": -1.101318359375,
"logps/chosen": -373.2749938964844,
"logps/rejected": -526.5499877929688,
"loss": 0.0141,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.2818846702575684,
"rewards/margins": 16.060937881469727,
"rewards/rejected": -19.34375,
"step": 5010
},
{
"epoch": 2.153631584593928,
"grad_norm": 0.053383814454467625,
"learning_rate": 4.61480686695279e-07,
"logits/chosen": -0.997802734375,
"logits/rejected": -1.0464355945587158,
"logps/chosen": -388.0249938964844,
"logps/rejected": -541.5250244140625,
"loss": 0.0101,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.4193358421325684,
"rewards/margins": 15.7421875,
"rewards/rejected": -19.157812118530273,
"step": 5020
},
{
"epoch": 2.157922969638451,
"grad_norm": 30.554006644635155,
"learning_rate": 4.604077253218884e-07,
"logits/chosen": -1.010839819908142,
"logits/rejected": -1.05712890625,
"logps/chosen": -389.9750061035156,
"logps/rejected": -565.0999755859375,
"loss": 0.0221,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.3442139625549316,
"rewards/margins": 16.832813262939453,
"rewards/rejected": -20.174999237060547,
"step": 5030
},
{
"epoch": 2.1622143546829737,
"grad_norm": 0.36406288211520504,
"learning_rate": 4.5933476394849785e-07,
"logits/chosen": -1.0473144054412842,
"logits/rejected": -1.095190405845642,
"logps/chosen": -410.92498779296875,
"logps/rejected": -543.8499755859375,
"loss": 0.0163,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.646679639816284,
"rewards/margins": 15.607812881469727,
"rewards/rejected": -19.265625,
"step": 5040
},
{
"epoch": 2.166505739727497,
"grad_norm": 1.3264477997536612,
"learning_rate": 4.5826180257510726e-07,
"logits/chosen": -1.056982398033142,
"logits/rejected": -1.09619140625,
"logps/chosen": -370.2749938964844,
"logps/rejected": -482.70001220703125,
"loss": 0.0094,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.526660203933716,
"rewards/margins": 16.501562118530273,
"rewards/rejected": -20.032812118530273,
"step": 5050
},
{
"epoch": 2.17079712477202,
"grad_norm": 0.127756197175878,
"learning_rate": 4.5718884120171667e-07,
"logits/chosen": -0.9688720703125,
"logits/rejected": -1.0232422351837158,
"logps/chosen": -389.0375061035156,
"logps/rejected": -525.3499755859375,
"loss": 0.0176,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.3698363304138184,
"rewards/margins": 16.307811737060547,
"rewards/rejected": -19.676563262939453,
"step": 5060
},
{
"epoch": 2.1750885098165433,
"grad_norm": 0.1689204957253295,
"learning_rate": 4.561158798283262e-07,
"logits/chosen": -0.90478515625,
"logits/rejected": -0.9461425542831421,
"logps/chosen": -384.6499938964844,
"logps/rejected": -550.0,
"loss": 0.0178,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.3662109375,
"rewards/margins": 16.768749237060547,
"rewards/rejected": -20.134374618530273,
"step": 5070
},
{
"epoch": 2.1793798948610665,
"grad_norm": 11.691878545403311,
"learning_rate": 4.550429184549356e-07,
"logits/chosen": -0.985058605670929,
"logits/rejected": -1.033203125,
"logps/chosen": -390.25,
"logps/rejected": -538.2750244140625,
"loss": 0.0134,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.363915920257568,
"rewards/margins": 17.29296875,
"rewards/rejected": -21.662500381469727,
"step": 5080
},
{
"epoch": 2.1836712799055897,
"grad_norm": 83.96859492226662,
"learning_rate": 4.5396995708154506e-07,
"logits/chosen": -0.990966796875,
"logits/rejected": -1.010656714439392,
"logps/chosen": -397.82501220703125,
"logps/rejected": -598.0999755859375,
"loss": 0.0095,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.075976371765137,
"rewards/margins": 17.720312118530273,
"rewards/rejected": -21.792186737060547,
"step": 5090
},
{
"epoch": 2.1879626649501125,
"grad_norm": 8.167130568299799,
"learning_rate": 4.528969957081545e-07,
"logits/chosen": -0.9888671636581421,
"logits/rejected": -1.0208008289337158,
"logps/chosen": -380.75,
"logps/rejected": -501.67498779296875,
"loss": 0.0178,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.988964796066284,
"rewards/margins": 15.824999809265137,
"rewards/rejected": -19.814062118530273,
"step": 5100
},
{
"epoch": 2.1922540499946357,
"grad_norm": 0.7514487648816531,
"learning_rate": 4.518240343347639e-07,
"logits/chosen": -1.0299866199493408,
"logits/rejected": -1.071069359779358,
"logps/chosen": -364.875,
"logps/rejected": -514.1500244140625,
"loss": 0.0045,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.192889213562012,
"rewards/margins": 16.693750381469727,
"rewards/rejected": -20.887500762939453,
"step": 5110
},
{
"epoch": 2.196545435039159,
"grad_norm": 1.9850796369896155,
"learning_rate": 4.507510729613734e-07,
"logits/chosen": -0.922009289264679,
"logits/rejected": -0.9329589605331421,
"logps/chosen": -437.57501220703125,
"logps/rejected": -537.3499755859375,
"loss": 0.0248,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.6697020530700684,
"rewards/margins": 16.026561737060547,
"rewards/rejected": -18.685937881469727,
"step": 5120
},
{
"epoch": 2.200836820083682,
"grad_norm": 0.7025867833273719,
"learning_rate": 4.496781115879828e-07,
"logits/chosen": -0.9795166254043579,
"logits/rejected": -1.039697289466858,
"logps/chosen": -404.375,
"logps/rejected": -516.2999877929688,
"loss": 0.0048,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.909472703933716,
"rewards/margins": 16.010936737060547,
"rewards/rejected": -18.928125381469727,
"step": 5130
},
{
"epoch": 2.2051282051282053,
"grad_norm": 0.3500906087515865,
"learning_rate": 4.486051502145923e-07,
"logits/chosen": -0.983715832233429,
"logits/rejected": -1.0534851551055908,
"logps/chosen": -432.54998779296875,
"logps/rejected": -539.0999755859375,
"loss": 0.0012,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.522509813308716,
"rewards/margins": 16.248437881469727,
"rewards/rejected": -18.770313262939453,
"step": 5140
},
{
"epoch": 2.209419590172728,
"grad_norm": 0.04524861441466119,
"learning_rate": 4.475321888412017e-07,
"logits/chosen": -1.0263671875,
"logits/rejected": -1.0385253429412842,
"logps/chosen": -406.7250061035156,
"logps/rejected": -550.4249877929688,
"loss": 0.0134,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.9786133766174316,
"rewards/margins": 17.032812118530273,
"rewards/rejected": -19.995311737060547,
"step": 5150
},
{
"epoch": 2.2137109752172512,
"grad_norm": 8.03434705267353,
"learning_rate": 4.464592274678111e-07,
"logits/chosen": -1.008935570716858,
"logits/rejected": -1.0579102039337158,
"logps/chosen": -387.7749938964844,
"logps/rejected": -529.75,
"loss": 0.0424,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.853222608566284,
"rewards/margins": 16.379688262939453,
"rewards/rejected": -19.231250762939453,
"step": 5160
},
{
"epoch": 2.2180023602617744,
"grad_norm": 47.28819703651963,
"learning_rate": 4.453862660944206e-07,
"logits/chosen": -0.909069836139679,
"logits/rejected": -0.9488281011581421,
"logps/chosen": -407.1499938964844,
"logps/rejected": -536.7999877929688,
"loss": 0.0195,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.4315428733825684,
"rewards/margins": 16.923437118530273,
"rewards/rejected": -20.364063262939453,
"step": 5170
},
{
"epoch": 2.2222937453062976,
"grad_norm": 2.083238998806373,
"learning_rate": 4.4431330472103003e-07,
"logits/chosen": -1.0880858898162842,
"logits/rejected": -1.1287109851837158,
"logps/chosen": -425.8500061035156,
"logps/rejected": -554.5,
"loss": 0.0368,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.27490234375,
"rewards/margins": 16.768749237060547,
"rewards/rejected": -20.03125,
"step": 5180
},
{
"epoch": 2.226585130350821,
"grad_norm": 0.4925850847248279,
"learning_rate": 4.432403433476395e-07,
"logits/chosen": -0.9459228515625,
"logits/rejected": -1.0033690929412842,
"logps/chosen": -367.92498779296875,
"logps/rejected": -504.875,
"loss": 0.0234,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.6727662086486816,
"rewards/margins": 15.846094131469727,
"rewards/rejected": -18.506250381469727,
"step": 5190
},
{
"epoch": 2.230876515395344,
"grad_norm": 5.7630945979082995,
"learning_rate": 4.421673819742489e-07,
"logits/chosen": -1.0013427734375,
"logits/rejected": -1.067285180091858,
"logps/chosen": -375.3999938964844,
"logps/rejected": -500.6000061035156,
"loss": 0.0143,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.674633741378784,
"rewards/margins": 15.443750381469727,
"rewards/rejected": -18.118749618530273,
"step": 5200
},
{
"epoch": 2.235167900439867,
"grad_norm": 1.5679725384583572,
"learning_rate": 4.410944206008583e-07,
"logits/chosen": -1.095800757408142,
"logits/rejected": -1.1016113758087158,
"logps/chosen": -387.1000061035156,
"logps/rejected": -550.4500122070312,
"loss": 0.0047,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.0596680641174316,
"rewards/margins": 16.259374618530273,
"rewards/rejected": -19.3359375,
"step": 5210
},
{
"epoch": 2.23945928548439,
"grad_norm": 0.03225714681207087,
"learning_rate": 4.4002145922746783e-07,
"logits/chosen": -0.998339831829071,
"logits/rejected": -1.0480468273162842,
"logps/chosen": -378.42498779296875,
"logps/rejected": -541.9000244140625,
"loss": 0.0065,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.501708984375,
"rewards/margins": 16.284374237060547,
"rewards/rejected": -19.776561737060547,
"step": 5220
},
{
"epoch": 2.243750670528913,
"grad_norm": 0.004920872976934373,
"learning_rate": 4.3894849785407724e-07,
"logits/chosen": -1.080175757408142,
"logits/rejected": -1.0818359851837158,
"logps/chosen": -406.82501220703125,
"logps/rejected": -576.5999755859375,
"loss": 0.0108,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.13037109375,
"rewards/margins": 17.79296875,
"rewards/rejected": -20.9296875,
"step": 5230
},
{
"epoch": 2.2480420555734364,
"grad_norm": 12.726439792503966,
"learning_rate": 4.378755364806867e-07,
"logits/chosen": -1.1072266101837158,
"logits/rejected": -1.160498023033142,
"logps/chosen": -433.75,
"logps/rejected": -555.3499755859375,
"loss": 0.0144,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.2865967750549316,
"rewards/margins": 17.217187881469727,
"rewards/rejected": -20.495311737060547,
"step": 5240
},
{
"epoch": 2.2523334406179596,
"grad_norm": 0.6472053356818118,
"learning_rate": 4.368025751072961e-07,
"logits/chosen": -1.0504882335662842,
"logits/rejected": -1.091406226158142,
"logps/chosen": -404.7250061035156,
"logps/rejected": -580.2999877929688,
"loss": 0.0132,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.839276313781738,
"rewards/margins": 17.854686737060547,
"rewards/rejected": -22.690624237060547,
"step": 5250
},
{
"epoch": 2.256624825662483,
"grad_norm": 2.120632098194414,
"learning_rate": 4.3572961373390553e-07,
"logits/chosen": -1.0519530773162842,
"logits/rejected": -1.104736328125,
"logps/chosen": -399.57501220703125,
"logps/rejected": -565.5,
"loss": 0.0104,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.434326171875,
"rewards/margins": 17.124217987060547,
"rewards/rejected": -21.556249618530273,
"step": 5260
},
{
"epoch": 2.2609162107070055,
"grad_norm": 0.2266722644435845,
"learning_rate": 4.3465665236051504e-07,
"logits/chosen": -1.061865210533142,
"logits/rejected": -1.102636694908142,
"logps/chosen": -398.70001220703125,
"logps/rejected": -555.4500122070312,
"loss": 0.0272,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.9124999046325684,
"rewards/margins": 15.9765625,
"rewards/rejected": -19.873437881469727,
"step": 5270
},
{
"epoch": 2.2652075957515287,
"grad_norm": 0.47840375623469705,
"learning_rate": 4.3358369098712445e-07,
"logits/chosen": -1.0869140625,
"logits/rejected": -1.1140625476837158,
"logps/chosen": -404.2250061035156,
"logps/rejected": -554.1500244140625,
"loss": 0.0048,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.31884765625,
"rewards/margins": 16.293750762939453,
"rewards/rejected": -19.607812881469727,
"step": 5280
},
{
"epoch": 2.269498980796052,
"grad_norm": 1.3972790081288071,
"learning_rate": 4.3251072961373387e-07,
"logits/chosen": -1.121191382408142,
"logits/rejected": -1.1702148914337158,
"logps/chosen": -427.67498779296875,
"logps/rejected": -543.2750244140625,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.4876952171325684,
"rewards/margins": 17.021875381469727,
"rewards/rejected": -20.515625,
"step": 5290
},
{
"epoch": 2.273790365840575,
"grad_norm": 7.753159743807861,
"learning_rate": 4.3143776824034333e-07,
"logits/chosen": -1.1396484375,
"logits/rejected": -1.14892578125,
"logps/chosen": -373.95001220703125,
"logps/rejected": -522.2999877929688,
"loss": 0.0053,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.731201171875,
"rewards/margins": 16.629688262939453,
"rewards/rejected": -20.356250762939453,
"step": 5300
},
{
"epoch": 2.2780817508850983,
"grad_norm": 1.5625678087647874,
"learning_rate": 4.3036480686695274e-07,
"logits/chosen": -1.0247681140899658,
"logits/rejected": -1.0874755382537842,
"logps/chosen": -422.82501220703125,
"logps/rejected": -543.0999755859375,
"loss": 0.0174,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.6404786109924316,
"rewards/margins": 16.012500762939453,
"rewards/rejected": -19.657032012939453,
"step": 5310
},
{
"epoch": 2.282373135929621,
"grad_norm": 0.6229183782132712,
"learning_rate": 4.2929184549356226e-07,
"logits/chosen": -1.095800757408142,
"logits/rejected": -1.1505858898162842,
"logps/chosen": -404.9750061035156,
"logps/rejected": -536.1500244140625,
"loss": 0.0142,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.1294922828674316,
"rewards/margins": 17.264062881469727,
"rewards/rejected": -20.396875381469727,
"step": 5320
},
{
"epoch": 2.2866645209741443,
"grad_norm": 0.3087413270696727,
"learning_rate": 4.2821888412017167e-07,
"logits/chosen": -1.1193358898162842,
"logits/rejected": -1.1549804210662842,
"logps/chosen": -417.92498779296875,
"logps/rejected": -546.6500244140625,
"loss": 0.0041,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.2455811500549316,
"rewards/margins": 15.850000381469727,
"rewards/rejected": -19.106250762939453,
"step": 5330
},
{
"epoch": 2.2909559060186675,
"grad_norm": 0.003652175168591188,
"learning_rate": 4.271459227467811e-07,
"logits/chosen": -1.068945288658142,
"logits/rejected": -1.1414062976837158,
"logps/chosen": -389.875,
"logps/rejected": -503.75,
"loss": 0.021,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.663818359375,
"rewards/margins": 15.785937309265137,
"rewards/rejected": -18.453125,
"step": 5340
},
{
"epoch": 2.2952472910631907,
"grad_norm": 3.884799768529656,
"learning_rate": 4.2607296137339054e-07,
"logits/chosen": -1.068457007408142,
"logits/rejected": -1.152734398841858,
"logps/chosen": -364.63751220703125,
"logps/rejected": -527.4749755859375,
"loss": 0.0133,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.917626976966858,
"rewards/margins": 16.182811737060547,
"rewards/rejected": -18.096874237060547,
"step": 5350
},
{
"epoch": 2.299538676107714,
"grad_norm": 0.16399496948065465,
"learning_rate": 4.2499999999999995e-07,
"logits/chosen": -1.111328125,
"logits/rejected": -1.1243164539337158,
"logps/chosen": -390.75,
"logps/rejected": -509.1499938964844,
"loss": 0.0096,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.883837938308716,
"rewards/margins": 14.521875381469727,
"rewards/rejected": -17.409374237060547,
"step": 5360
},
{
"epoch": 2.3038300611522367,
"grad_norm": 0.12459157726055184,
"learning_rate": 4.2392703862660947e-07,
"logits/chosen": -1.094482421875,
"logits/rejected": -1.155908226966858,
"logps/chosen": -411.2250061035156,
"logps/rejected": -474.8500061035156,
"loss": 0.0143,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.8063476085662842,
"rewards/margins": 15.239062309265137,
"rewards/rejected": -17.051563262939453,
"step": 5370
},
{
"epoch": 2.30812144619676,
"grad_norm": 0.041684749572121406,
"learning_rate": 4.228540772532189e-07,
"logits/chosen": -1.0705077648162842,
"logits/rejected": -1.136132836341858,
"logps/chosen": -394.7875061035156,
"logps/rejected": -525.5999755859375,
"loss": 0.0066,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.0628418922424316,
"rewards/margins": 16.475000381469727,
"rewards/rejected": -18.53125,
"step": 5380
},
{
"epoch": 2.312412831241283,
"grad_norm": 0.4458624637924813,
"learning_rate": 4.217811158798283e-07,
"logits/chosen": -1.0709717273712158,
"logits/rejected": -1.086755394935608,
"logps/chosen": -363.6000061035156,
"logps/rejected": -522.0,
"loss": 0.0266,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.9620361328125,
"rewards/margins": 15.334375381469727,
"rewards/rejected": -18.293750762939453,
"step": 5390
},
{
"epoch": 2.3167042162858063,
"grad_norm": 1.0838703671622913,
"learning_rate": 4.2070815450643776e-07,
"logits/chosen": -1.082421898841858,
"logits/rejected": -1.133544921875,
"logps/chosen": -370.04998779296875,
"logps/rejected": -534.5,
"loss": 0.0331,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.82958984375,
"rewards/margins": 16.793750762939453,
"rewards/rejected": -20.628124237060547,
"step": 5400
},
{
"epoch": 2.3209956013303294,
"grad_norm": 0.26152986942580675,
"learning_rate": 4.1963519313304717e-07,
"logits/chosen": -1.1138184070587158,
"logits/rejected": -1.167504906654358,
"logps/chosen": -381.4750061035156,
"logps/rejected": -542.2000122070312,
"loss": 0.006,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.64007568359375,
"rewards/margins": 17.375,
"rewards/rejected": -20.034374237060547,
"step": 5410
},
{
"epoch": 2.3252869863748526,
"grad_norm": 0.0019311125967350841,
"learning_rate": 4.185622317596567e-07,
"logits/chosen": -1.09033203125,
"logits/rejected": -1.116943359375,
"logps/chosen": -377.29998779296875,
"logps/rejected": -535.7000122070312,
"loss": 0.0201,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.8272461891174316,
"rewards/margins": 16.582813262939453,
"rewards/rejected": -19.418750762939453,
"step": 5420
},
{
"epoch": 2.329578371419376,
"grad_norm": 14.480264934693706,
"learning_rate": 4.174892703862661e-07,
"logits/chosen": -1.1448242664337158,
"logits/rejected": -1.1791503429412842,
"logps/chosen": -411.42498779296875,
"logps/rejected": -538.5750122070312,
"loss": 0.0064,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.0055909156799316,
"rewards/margins": 17.0546875,
"rewards/rejected": -20.056249618530273,
"step": 5430
},
{
"epoch": 2.3338697564638986,
"grad_norm": 0.3593446635187225,
"learning_rate": 4.164163090128755e-07,
"logits/chosen": -1.120361328125,
"logits/rejected": -1.1204102039337158,
"logps/chosen": -378.70001220703125,
"logps/rejected": -557.125,
"loss": 0.0092,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.4407105445861816,
"rewards/margins": 16.876562118530273,
"rewards/rejected": -20.3203125,
"step": 5440
},
{
"epoch": 2.338161141508422,
"grad_norm": 0.007330612517640106,
"learning_rate": 4.1534334763948497e-07,
"logits/chosen": -1.137109398841858,
"logits/rejected": -1.191015601158142,
"logps/chosen": -412.57501220703125,
"logps/rejected": -534.9500122070312,
"loss": 0.0132,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.130859375,
"rewards/margins": 16.567188262939453,
"rewards/rejected": -19.681249618530273,
"step": 5450
},
{
"epoch": 2.342452526552945,
"grad_norm": 0.8087353389458987,
"learning_rate": 4.142703862660944e-07,
"logits/chosen": -1.201416015625,
"logits/rejected": -1.24951171875,
"logps/chosen": -420.0249938964844,
"logps/rejected": -536.7999877929688,
"loss": 0.01,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.246923923492432,
"rewards/margins": 16.125,
"rewards/rejected": -20.373437881469727,
"step": 5460
},
{
"epoch": 2.346743911597468,
"grad_norm": 4.755790898336294,
"learning_rate": 4.131974248927038e-07,
"logits/chosen": -1.124902367591858,
"logits/rejected": -1.1564452648162842,
"logps/chosen": -385.4750061035156,
"logps/rejected": -515.7999877929688,
"loss": 0.0134,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.160717725753784,
"rewards/margins": 16.515625,
"rewards/rejected": -19.671875,
"step": 5470
},
{
"epoch": 2.3510352966419914,
"grad_norm": 0.16957193415368896,
"learning_rate": 4.121244635193133e-07,
"logits/chosen": -1.09423828125,
"logits/rejected": -1.149072289466858,
"logps/chosen": -375.8999938964844,
"logps/rejected": -542.7999877929688,
"loss": 0.0088,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.269189357757568,
"rewards/margins": 16.610937118530273,
"rewards/rejected": -20.887500762939453,
"step": 5480
},
{
"epoch": 2.355326681686514,
"grad_norm": 0.5155251966851477,
"learning_rate": 4.110515021459227e-07,
"logits/chosen": -1.1798827648162842,
"logits/rejected": -1.2258789539337158,
"logps/chosen": -426.07501220703125,
"logps/rejected": -551.4500122070312,
"loss": 0.0051,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.3642578125,
"rewards/margins": 17.207813262939453,
"rewards/rejected": -20.578125,
"step": 5490
},
{
"epoch": 2.3596180667310374,
"grad_norm": 0.03925810644275777,
"learning_rate": 4.099785407725322e-07,
"logits/chosen": -1.156152367591858,
"logits/rejected": -1.206152319908142,
"logps/chosen": -389.29998779296875,
"logps/rejected": -517.4749755859375,
"loss": 0.0229,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.204296827316284,
"rewards/margins": 15.995312690734863,
"rewards/rejected": -19.196874618530273,
"step": 5500
},
{
"epoch": 2.3639094517755606,
"grad_norm": 0.06456187153106611,
"learning_rate": 4.089055793991416e-07,
"logits/chosen": -1.136621117591858,
"logits/rejected": -1.1979491710662842,
"logps/chosen": -427.25,
"logps/rejected": -528.25,
"loss": 0.0198,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.3629393577575684,
"rewards/margins": 15.651562690734863,
"rewards/rejected": -19.009374618530273,
"step": 5510
},
{
"epoch": 2.3682008368200838,
"grad_norm": 44.63832046339587,
"learning_rate": 4.07832618025751e-07,
"logits/chosen": -1.137451171875,
"logits/rejected": -1.160986304283142,
"logps/chosen": -403.5,
"logps/rejected": -565.4500122070312,
"loss": 0.0017,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.7186279296875,
"rewards/margins": 17.582813262939453,
"rewards/rejected": -20.3046875,
"step": 5520
},
{
"epoch": 2.372492221864607,
"grad_norm": 0.7412019086772551,
"learning_rate": 4.067596566523605e-07,
"logits/chosen": -1.215966820716858,
"logits/rejected": -1.234960913658142,
"logps/chosen": -396.4750061035156,
"logps/rejected": -546.5,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.4859375953674316,
"rewards/margins": 17.003124237060547,
"rewards/rejected": -20.496875762939453,
"step": 5530
},
{
"epoch": 2.3767836069091297,
"grad_norm": 0.8700084075218637,
"learning_rate": 4.0568669527896993e-07,
"logits/chosen": -1.1442382335662842,
"logits/rejected": -1.1884276866912842,
"logps/chosen": -399.4750061035156,
"logps/rejected": -557.9500122070312,
"loss": 0.0136,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.8752808570861816,
"rewards/margins": 16.350000381469727,
"rewards/rejected": -20.225000381469727,
"step": 5540
},
{
"epoch": 2.381074991953653,
"grad_norm": 10.853439155676176,
"learning_rate": 4.046137339055794e-07,
"logits/chosen": -1.1411621570587158,
"logits/rejected": -1.2041504383087158,
"logps/chosen": -448.5249938964844,
"logps/rejected": -552.6500244140625,
"loss": 0.0081,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.804003953933716,
"rewards/margins": 16.563282012939453,
"rewards/rejected": -20.364063262939453,
"step": 5550
},
{
"epoch": 2.385366376998176,
"grad_norm": 0.2803492463732435,
"learning_rate": 4.035407725321888e-07,
"logits/chosen": -1.1279785633087158,
"logits/rejected": -1.171777367591858,
"logps/chosen": -408.92498779296875,
"logps/rejected": -555.4500122070312,
"loss": 0.0203,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.272216796875,
"rewards/margins": 15.560937881469727,
"rewards/rejected": -18.831249237060547,
"step": 5560
},
{
"epoch": 2.3896577620426993,
"grad_norm": 0.11846212570441392,
"learning_rate": 4.024678111587982e-07,
"logits/chosen": -1.095330834388733,
"logits/rejected": -1.135986328125,
"logps/chosen": -414.2250061035156,
"logps/rejected": -567.7999877929688,
"loss": 0.0015,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.0911865234375,
"rewards/margins": 17.964061737060547,
"rewards/rejected": -21.049999237060547,
"step": 5570
},
{
"epoch": 2.3939491470872225,
"grad_norm": 30.694543881692244,
"learning_rate": 4.0139484978540774e-07,
"logits/chosen": -1.136865258216858,
"logits/rejected": -1.18017578125,
"logps/chosen": -381.5874938964844,
"logps/rejected": -525.2999877929688,
"loss": 0.0255,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.421826124191284,
"rewards/margins": 15.760937690734863,
"rewards/rejected": -19.178905487060547,
"step": 5580
},
{
"epoch": 2.3982405321317457,
"grad_norm": 111.97407297625111,
"learning_rate": 4.0032188841201715e-07,
"logits/chosen": -1.190527319908142,
"logits/rejected": -1.2721679210662842,
"logps/chosen": -386.67498779296875,
"logps/rejected": -502.04998779296875,
"loss": 0.0166,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.891406297683716,
"rewards/margins": 14.465624809265137,
"rewards/rejected": -18.353124618530273,
"step": 5590
},
{
"epoch": 2.4025319171762685,
"grad_norm": 0.6633418000195235,
"learning_rate": 3.992489270386266e-07,
"logits/chosen": -1.0438964366912842,
"logits/rejected": -1.097387671470642,
"logps/chosen": -406.5,
"logps/rejected": -586.9000244140625,
"loss": 0.018,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.134375095367432,
"rewards/margins": 17.787500381469727,
"rewards/rejected": -21.918750762939453,
"step": 5600
},
{
"epoch": 2.4068233022207917,
"grad_norm": 0.13014608405177375,
"learning_rate": 3.98175965665236e-07,
"logits/chosen": -1.1730468273162842,
"logits/rejected": -1.21875,
"logps/chosen": -426.07501220703125,
"logps/rejected": -563.5999755859375,
"loss": 0.0012,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.1102051734924316,
"rewards/margins": 17.415624618530273,
"rewards/rejected": -20.528125762939453,
"step": 5610
},
{
"epoch": 2.411114687265315,
"grad_norm": 0.06941121138354146,
"learning_rate": 3.9710300429184543e-07,
"logits/chosen": -1.0751464366912842,
"logits/rejected": -1.101831078529358,
"logps/chosen": -367.45001220703125,
"logps/rejected": -513.0,
"loss": 0.0062,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.8021483421325684,
"rewards/margins": 16.232812881469727,
"rewards/rejected": -20.046875,
"step": 5620
},
{
"epoch": 2.415406072309838,
"grad_norm": 0.05770604341823292,
"learning_rate": 3.9603004291845495e-07,
"logits/chosen": -1.1044433116912842,
"logits/rejected": -1.139794945716858,
"logps/chosen": -387.3999938964844,
"logps/rejected": -555.0999755859375,
"loss": 0.0192,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.205883741378784,
"rewards/margins": 16.59375,
"rewards/rejected": -19.796875,
"step": 5630
},
{
"epoch": 2.4196974573543613,
"grad_norm": 0.3871990584566747,
"learning_rate": 3.9495708154506436e-07,
"logits/chosen": -1.102270483970642,
"logits/rejected": -1.134667992591858,
"logps/chosen": -395.82501220703125,
"logps/rejected": -564.4749755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.7181639671325684,
"rewards/margins": 17.6640625,
"rewards/rejected": -21.373437881469727,
"step": 5640
},
{
"epoch": 2.4239888423988845,
"grad_norm": 0.22896203342676788,
"learning_rate": 3.938841201716738e-07,
"logits/chosen": -1.145117163658142,
"logits/rejected": -1.1711914539337158,
"logps/chosen": -411.9750061035156,
"logps/rejected": -519.4500122070312,
"loss": 0.0139,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.2725586891174316,
"rewards/margins": 15.540624618530273,
"rewards/rejected": -18.815624237060547,
"step": 5650
},
{
"epoch": 2.428280227443407,
"grad_norm": 0.04906188875799851,
"learning_rate": 3.9281115879828324e-07,
"logits/chosen": -1.1149413585662842,
"logits/rejected": -1.1267578601837158,
"logps/chosen": -402.1499938964844,
"logps/rejected": -534.2999877929688,
"loss": 0.0137,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.295117139816284,
"rewards/margins": 16.167186737060547,
"rewards/rejected": -19.457813262939453,
"step": 5660
},
{
"epoch": 2.4325716124879304,
"grad_norm": 0.04723832920646726,
"learning_rate": 3.9173819742489265e-07,
"logits/chosen": -1.178320288658142,
"logits/rejected": -1.22265625,
"logps/chosen": -393.5625,
"logps/rejected": -527.0750122070312,
"loss": 0.0122,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.374462842941284,
"rewards/margins": 15.359375,
"rewards/rejected": -17.740625381469727,
"step": 5670
},
{
"epoch": 2.4368629975324536,
"grad_norm": 4.204694029302814,
"learning_rate": 3.9066523605150216e-07,
"logits/chosen": -1.1519043445587158,
"logits/rejected": -1.1873047351837158,
"logps/chosen": -426.1625061035156,
"logps/rejected": -559.4500122070312,
"loss": 0.0006,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.138378858566284,
"rewards/margins": 16.940624237060547,
"rewards/rejected": -20.089061737060547,
"step": 5680
},
{
"epoch": 2.441154382576977,
"grad_norm": 8.874464532835788,
"learning_rate": 3.895922746781116e-07,
"logits/chosen": -1.156835913658142,
"logits/rejected": -1.219751000404358,
"logps/chosen": -408.32501220703125,
"logps/rejected": -513.7000122070312,
"loss": 0.0072,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.2947754859924316,
"rewards/margins": 16.020313262939453,
"rewards/rejected": -18.296875,
"step": 5690
},
{
"epoch": 2.4454457676215,
"grad_norm": 1.0893991899078694,
"learning_rate": 3.88519313304721e-07,
"logits/chosen": -1.19921875,
"logits/rejected": -1.2463867664337158,
"logps/chosen": -406.5625,
"logps/rejected": -536.4000244140625,
"loss": 0.0051,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.3580565452575684,
"rewards/margins": 15.4296875,
"rewards/rejected": -17.798437118530273,
"step": 5700
},
{
"epoch": 2.4497371526660228,
"grad_norm": 2.7537734287907516,
"learning_rate": 3.8744635193133045e-07,
"logits/chosen": -1.1779296398162842,
"logits/rejected": -1.244042992591858,
"logps/chosen": -394.20001220703125,
"logps/rejected": -514.25,
"loss": 0.01,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.367358446121216,
"rewards/margins": 15.1484375,
"rewards/rejected": -17.509374618530273,
"step": 5710
},
{
"epoch": 2.454028537710546,
"grad_norm": 0.05462432706493854,
"learning_rate": 3.8637339055793986e-07,
"logits/chosen": -1.158593773841858,
"logits/rejected": -1.1767578125,
"logps/chosen": -398.20001220703125,
"logps/rejected": -530.2000122070312,
"loss": 0.0178,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.8426756858825684,
"rewards/margins": 15.193750381469727,
"rewards/rejected": -18.034374237060547,
"step": 5720
},
{
"epoch": 2.458319922755069,
"grad_norm": 0.051379750848194,
"learning_rate": 3.853004291845494e-07,
"logits/chosen": -1.146826148033142,
"logits/rejected": -1.184228539466858,
"logps/chosen": -404.5,
"logps/rejected": -525.5250244140625,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.1160826683044434,
"rewards/margins": 16.334375381469727,
"rewards/rejected": -18.456249237060547,
"step": 5730
},
{
"epoch": 2.4626113077995924,
"grad_norm": 0.484295764086103,
"learning_rate": 3.842274678111588e-07,
"logits/chosen": -1.123388648033142,
"logits/rejected": -1.179101586341858,
"logps/chosen": -415.625,
"logps/rejected": -545.6500244140625,
"loss": 0.0024,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.1312804222106934,
"rewards/margins": 16.411718368530273,
"rewards/rejected": -18.551563262939453,
"step": 5740
},
{
"epoch": 2.4669026928441156,
"grad_norm": 0.6610913120056842,
"learning_rate": 3.831545064377682e-07,
"logits/chosen": -1.1625487804412842,
"logits/rejected": -1.1875,
"logps/chosen": -399.125,
"logps/rejected": -557.0999755859375,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.4585938453674316,
"rewards/margins": 17.785938262939453,
"rewards/rejected": -20.253124237060547,
"step": 5750
},
{
"epoch": 2.4711940778886383,
"grad_norm": 0.7450581301080623,
"learning_rate": 3.8208154506437766e-07,
"logits/chosen": -1.1408202648162842,
"logits/rejected": -1.20166015625,
"logps/chosen": -384.7749938964844,
"logps/rejected": -546.2999877929688,
"loss": 0.0015,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.016162157058716,
"rewards/margins": 17.685937881469727,
"rewards/rejected": -20.698436737060547,
"step": 5760
},
{
"epoch": 2.4754854629331615,
"grad_norm": 1.311313141668686,
"learning_rate": 3.810085836909871e-07,
"logits/chosen": -1.0562012195587158,
"logits/rejected": -1.0993163585662842,
"logps/chosen": -395.2250061035156,
"logps/rejected": -524.3499755859375,
"loss": 0.0314,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.298877000808716,
"rewards/margins": 16.353124618530273,
"rewards/rejected": -19.662500381469727,
"step": 5770
},
{
"epoch": 2.4797768479776847,
"grad_norm": 0.3396052960460103,
"learning_rate": 3.799356223175966e-07,
"logits/chosen": -1.0969727039337158,
"logits/rejected": -1.123632788658142,
"logps/chosen": -416.54998779296875,
"logps/rejected": -547.2999877929688,
"loss": 0.0153,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.7972412109375,
"rewards/margins": 17.232812881469727,
"rewards/rejected": -21.021875381469727,
"step": 5780
},
{
"epoch": 2.484068233022208,
"grad_norm": 0.04814824063700462,
"learning_rate": 3.78862660944206e-07,
"logits/chosen": -1.0678222179412842,
"logits/rejected": -1.1090819835662842,
"logps/chosen": -417.7749938964844,
"logps/rejected": -588.4000244140625,
"loss": 0.009,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.4354491233825684,
"rewards/margins": 17.424999237060547,
"rewards/rejected": -20.862499237060547,
"step": 5790
},
{
"epoch": 2.488359618066731,
"grad_norm": 0.06811507493157097,
"learning_rate": 3.777896995708154e-07,
"logits/chosen": -1.046179175376892,
"logits/rejected": -1.060937523841858,
"logps/chosen": -410.20001220703125,
"logps/rejected": -531.9749755859375,
"loss": 0.0168,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.8173828125,
"rewards/margins": 16.645313262939453,
"rewards/rejected": -20.456249237060547,
"step": 5800
},
{
"epoch": 2.4926510031112543,
"grad_norm": 2.1486622037504417,
"learning_rate": 3.767167381974249e-07,
"logits/chosen": -1.106298804283142,
"logits/rejected": -1.143896460533142,
"logps/chosen": -423.82501220703125,
"logps/rejected": -566.75,
"loss": 0.002,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.128515720367432,
"rewards/margins": 15.717187881469727,
"rewards/rejected": -19.853124618530273,
"step": 5810
},
{
"epoch": 2.4969423881557775,
"grad_norm": 0.04581458119624618,
"learning_rate": 3.756437768240343e-07,
"logits/chosen": -1.1095702648162842,
"logits/rejected": -1.171972632408142,
"logps/chosen": -369.45001220703125,
"logps/rejected": -522.0999755859375,
"loss": 0.0137,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.3989500999450684,
"rewards/margins": 16.640625,
"rewards/rejected": -20.043750762939453,
"step": 5820
},
{
"epoch": 2.5012337732003003,
"grad_norm": 1.52969525532562,
"learning_rate": 3.745708154506438e-07,
"logits/chosen": -1.089501976966858,
"logits/rejected": -1.127587914466858,
"logps/chosen": -372.3500061035156,
"logps/rejected": -539.375,
"loss": 0.0138,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.6758055686950684,
"rewards/margins": 15.704687118530273,
"rewards/rejected": -19.375,
"step": 5830
},
{
"epoch": 2.5055251582448235,
"grad_norm": 0.2909350294143109,
"learning_rate": 3.734978540772532e-07,
"logits/chosen": -1.067968726158142,
"logits/rejected": -1.1033203601837158,
"logps/chosen": -397.125,
"logps/rejected": -535.75,
"loss": 0.0049,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.7779784202575684,
"rewards/margins": 15.651562690734863,
"rewards/rejected": -19.4296875,
"step": 5840
},
{
"epoch": 2.5098165432893467,
"grad_norm": 0.13216010408953385,
"learning_rate": 3.7242489270386263e-07,
"logits/chosen": -1.064306616783142,
"logits/rejected": -1.1462891101837158,
"logps/chosen": -414.8500061035156,
"logps/rejected": -565.6500244140625,
"loss": 0.0199,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.442578077316284,
"rewards/margins": 17.60546875,
"rewards/rejected": -21.042186737060547,
"step": 5850
},
{
"epoch": 2.51410792833387,
"grad_norm": 0.1458522240029636,
"learning_rate": 3.713519313304721e-07,
"logits/chosen": -1.0082519054412842,
"logits/rejected": -1.050390601158142,
"logps/chosen": -366.45001220703125,
"logps/rejected": -476.07501220703125,
"loss": 0.0141,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.1866698265075684,
"rewards/margins": 15.307812690734863,
"rewards/rejected": -18.509374618530273,
"step": 5860
},
{
"epoch": 2.518399313378393,
"grad_norm": 1.0790216027876043,
"learning_rate": 3.702789699570815e-07,
"logits/chosen": -1.1498534679412842,
"logits/rejected": -1.192968726158142,
"logps/chosen": -400.2875061035156,
"logps/rejected": -555.5999755859375,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.5619874000549316,
"rewards/margins": 16.957813262939453,
"rewards/rejected": -20.5234375,
"step": 5870
},
{
"epoch": 2.522690698422916,
"grad_norm": 21.411581447229803,
"learning_rate": 3.69206008583691e-07,
"logits/chosen": -1.150976538658142,
"logits/rejected": -1.16259765625,
"logps/chosen": -413.1499938964844,
"logps/rejected": -543.8499755859375,
"loss": 0.0163,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.542773485183716,
"rewards/margins": 16.506250381469727,
"rewards/rejected": -20.057811737060547,
"step": 5880
},
{
"epoch": 2.526982083467439,
"grad_norm": 0.063624364626722,
"learning_rate": 3.6813304721030043e-07,
"logits/chosen": -1.1453857421875,
"logits/rejected": -1.1608397960662842,
"logps/chosen": -393.3999938964844,
"logps/rejected": -531.9000244140625,
"loss": 0.0105,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.4307618141174316,
"rewards/margins": 15.641406059265137,
"rewards/rejected": -19.064062118530273,
"step": 5890
},
{
"epoch": 2.531273468511962,
"grad_norm": 0.01016691276465561,
"learning_rate": 3.6706008583690984e-07,
"logits/chosen": -1.1398437023162842,
"logits/rejected": -1.1657226085662842,
"logps/chosen": -379.38751220703125,
"logps/rejected": -525.5,
"loss": 0.0327,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.431103467941284,
"rewards/margins": 15.796875,
"rewards/rejected": -18.235937118530273,
"step": 5900
},
{
"epoch": 2.5355648535564854,
"grad_norm": 1.5617445529583414,
"learning_rate": 3.659871244635193e-07,
"logits/chosen": -1.2175781726837158,
"logits/rejected": -1.2086913585662842,
"logps/chosen": -388.79998779296875,
"logps/rejected": -511.45001220703125,
"loss": 0.0087,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.7445921897888184,
"rewards/margins": 15.125,
"rewards/rejected": -17.871875762939453,
"step": 5910
},
{
"epoch": 2.5398562386010086,
"grad_norm": 3.0247896748281113,
"learning_rate": 3.649141630901287e-07,
"logits/chosen": -1.1659667491912842,
"logits/rejected": -1.229248046875,
"logps/chosen": -395.67498779296875,
"logps/rejected": -553.2999877929688,
"loss": 0.0022,
"rewards/accuracies": 1.0,
"rewards/chosen": -2.319506883621216,
"rewards/margins": 16.403125762939453,
"rewards/rejected": -18.735937118530273,
"step": 5920
},
{
"epoch": 2.5441476236455314,
"grad_norm": 0.12037995513584396,
"learning_rate": 3.638412017167382e-07,
"logits/chosen": -1.159570336341858,
"logits/rejected": -1.2067382335662842,
"logps/chosen": -396.48748779296875,
"logps/rejected": -513.7000122070312,
"loss": 0.009,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.9020111560821533,
"rewards/margins": 15.9453125,
"rewards/rejected": -17.84375,
"step": 5930
},
{
"epoch": 2.5484390086900546,
"grad_norm": 0.0533418216161194,
"learning_rate": 3.6276824034334764e-07,
"logits/chosen": -1.101953148841858,
"logits/rejected": -1.157373070716858,
"logps/chosen": -376.75,
"logps/rejected": -520.3499755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.12359619140625,
"rewards/margins": 15.671875,
"rewards/rejected": -17.790624618530273,
"step": 5940
},
{
"epoch": 2.5527303937345778,
"grad_norm": 3.651463623931559,
"learning_rate": 3.6169527896995706e-07,
"logits/chosen": -1.1693847179412842,
"logits/rejected": -1.190332055091858,
"logps/chosen": -383.67498779296875,
"logps/rejected": -497.3999938964844,
"loss": 0.0175,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.9588744640350342,
"rewards/margins": 15.667187690734863,
"rewards/rejected": -17.629688262939453,
"step": 5950
},
{
"epoch": 2.557021778779101,
"grad_norm": 0.08250108047939421,
"learning_rate": 3.606223175965665e-07,
"logits/chosen": -1.133642554283142,
"logits/rejected": -1.194921851158142,
"logps/chosen": -425.61248779296875,
"logps/rejected": -512.7999877929688,
"loss": 0.0137,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.364971876144409,
"rewards/margins": 16.376562118530273,
"rewards/rejected": -18.743749618530273,
"step": 5960
},
{
"epoch": 2.561313163823624,
"grad_norm": 25.782703464304635,
"learning_rate": 3.5954935622317593e-07,
"logits/chosen": -1.117089867591858,
"logits/rejected": -1.174707055091858,
"logps/chosen": -388.82501220703125,
"logps/rejected": -517.5499877929688,
"loss": 0.0099,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.824267625808716,
"rewards/margins": 15.1953125,
"rewards/rejected": -18.0078125,
"step": 5970
},
{
"epoch": 2.565604548868147,
"grad_norm": 0.03578850988641143,
"learning_rate": 3.584763948497854e-07,
"logits/chosen": -1.1417236328125,
"logits/rejected": -1.17041015625,
"logps/chosen": -419.3999938964844,
"logps/rejected": -534.0,
"loss": 0.0047,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.2840819358825684,
"rewards/margins": 15.675000190734863,
"rewards/rejected": -18.9609375,
"step": 5980
},
{
"epoch": 2.5698959339126706,
"grad_norm": 0.08619582933257304,
"learning_rate": 3.5740343347639486e-07,
"logits/chosen": -1.071533203125,
"logits/rejected": -1.09228515625,
"logps/chosen": -419.375,
"logps/rejected": -550.125,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.695141553878784,
"rewards/margins": 16.954687118530273,
"rewards/rejected": -20.651561737060547,
"step": 5990
},
{
"epoch": 2.5741873189571933,
"grad_norm": 0.027925863872517394,
"learning_rate": 3.5633047210300427e-07,
"logits/chosen": -1.094335913658142,
"logits/rejected": -1.1645996570587158,
"logps/chosen": -368.45001220703125,
"logps/rejected": -517.25,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.3781371116638184,
"rewards/margins": 16.2265625,
"rewards/rejected": -19.618749618530273,
"step": 6000
},
{
"epoch": 2.5784787040017165,
"grad_norm": 0.4479928190697049,
"learning_rate": 3.5525751072961373e-07,
"logits/chosen": -1.1359374523162842,
"logits/rejected": -1.155029296875,
"logps/chosen": -409.07501220703125,
"logps/rejected": -543.4500122070312,
"loss": 0.0055,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.545483350753784,
"rewards/margins": 17.326562881469727,
"rewards/rejected": -19.885936737060547,
"step": 6010
},
{
"epoch": 2.5827700890462397,
"grad_norm": 0.06470103911127432,
"learning_rate": 3.5418454935622314e-07,
"logits/chosen": -1.0671875476837158,
"logits/rejected": -1.1250731945037842,
"logps/chosen": -362.9750061035156,
"logps/rejected": -529.4000244140625,
"loss": 0.0007,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.0658936500549316,
"rewards/margins": 16.126562118530273,
"rewards/rejected": -19.201562881469727,
"step": 6020
},
{
"epoch": 2.587061474090763,
"grad_norm": 0.6485464310767913,
"learning_rate": 3.531115879828326e-07,
"logits/chosen": -1.1291992664337158,
"logits/rejected": -1.1618163585662842,
"logps/chosen": -389.0,
"logps/rejected": -536.7999877929688,
"loss": 0.0114,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.468554735183716,
"rewards/margins": 17.6875,
"rewards/rejected": -21.157812118530273,
"step": 6030
},
{
"epoch": 2.591352859135286,
"grad_norm": 0.0688533411850023,
"learning_rate": 3.5203862660944207e-07,
"logits/chosen": -1.049523949623108,
"logits/rejected": -1.121801733970642,
"logps/chosen": -378.7250061035156,
"logps/rejected": -501.2250061035156,
"loss": 0.0482,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.294482469558716,
"rewards/margins": 15.535937309265137,
"rewards/rejected": -17.837499618530273,
"step": 6040
},
{
"epoch": 2.595644244179809,
"grad_norm": 16.365263159961124,
"learning_rate": 3.509656652360515e-07,
"logits/chosen": -1.085058569908142,
"logits/rejected": -1.0940430164337158,
"logps/chosen": -354.8500061035156,
"logps/rejected": -525.0,
"loss": 0.0093,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.345043897628784,
"rewards/margins": 16.053125381469727,
"rewards/rejected": -19.403125762939453,
"step": 6050
},
{
"epoch": 2.599935629224332,
"grad_norm": 4.047277602416829,
"learning_rate": 3.4989270386266095e-07,
"logits/chosen": -1.113183617591858,
"logits/rejected": -1.154687523841858,
"logps/chosen": -431.7124938964844,
"logps/rejected": -551.25,
"loss": 0.0117,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.344970703125,
"rewards/margins": 17.181249618530273,
"rewards/rejected": -20.509374618530273,
"step": 6060
},
{
"epoch": 2.6042270142688553,
"grad_norm": 0.3130990368515212,
"learning_rate": 3.4881974248927036e-07,
"logits/chosen": -0.9510742425918579,
"logits/rejected": -1.0143554210662842,
"logps/chosen": -369.4750061035156,
"logps/rejected": -523.0999755859375,
"loss": 0.0235,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.5815186500549316,
"rewards/margins": 17.015625,
"rewards/rejected": -19.610937118530273,
"step": 6070
},
{
"epoch": 2.6085183993133785,
"grad_norm": 0.3784010252488101,
"learning_rate": 3.4774678111587977e-07,
"logits/chosen": -1.13525390625,
"logits/rejected": -1.1865234375,
"logps/chosen": -395.125,
"logps/rejected": -550.6500244140625,
"loss": 0.0004,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.036816358566284,
"rewards/margins": 16.868749618530273,
"rewards/rejected": -19.907812118530273,
"step": 6080
},
{
"epoch": 2.6128097843579017,
"grad_norm": 1.4778778603259732,
"learning_rate": 3.466738197424893e-07,
"logits/chosen": -1.1120116710662842,
"logits/rejected": -1.148046851158142,
"logps/chosen": -405.6499938964844,
"logps/rejected": -531.2999877929688,
"loss": 0.0054,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.806347608566284,
"rewards/margins": 17.1015625,
"rewards/rejected": -19.924999237060547,
"step": 6090
},
{
"epoch": 2.6171011694024244,
"grad_norm": 3.4659834168960564,
"learning_rate": 3.456008583690987e-07,
"logits/chosen": -1.1062500476837158,
"logits/rejected": -1.144677758216858,
"logps/chosen": -398.0249938964844,
"logps/rejected": -533.3499755859375,
"loss": 0.0069,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.404296875,
"rewards/margins": 17.1328125,
"rewards/rejected": -20.5390625,
"step": 6100
},
{
"epoch": 2.6213925544469476,
"grad_norm": 0.3397205704093927,
"learning_rate": 3.445278969957081e-07,
"logits/chosen": -1.118554711341858,
"logits/rejected": -1.148339867591858,
"logps/chosen": -431.04998779296875,
"logps/rejected": -563.25,
"loss": 0.0058,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.5126953125,
"rewards/margins": 16.701562881469727,
"rewards/rejected": -20.214061737060547,
"step": 6110
},
{
"epoch": 2.625683939491471,
"grad_norm": 0.09021591985807836,
"learning_rate": 3.4345493562231757e-07,
"logits/chosen": -1.115014672279358,
"logits/rejected": -1.1656372547149658,
"logps/chosen": -404.17498779296875,
"logps/rejected": -566.75,
"loss": 0.0058,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.7041993141174316,
"rewards/margins": 17.203125,
"rewards/rejected": -19.912500381469727,
"step": 6120
},
{
"epoch": 2.629975324535994,
"grad_norm": 0.033456552404593026,
"learning_rate": 3.42381974248927e-07,
"logits/chosen": -1.1680176258087158,
"logits/rejected": -1.219140648841858,
"logps/chosen": -401.20001220703125,
"logps/rejected": -536.9000244140625,
"loss": 0.0162,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.124267578125,
"rewards/margins": 16.042186737060547,
"rewards/rejected": -18.170312881469727,
"step": 6130
},
{
"epoch": 2.6342667095805172,
"grad_norm": 0.012679231099117165,
"learning_rate": 3.413090128755365e-07,
"logits/chosen": -1.0952637195587158,
"logits/rejected": -1.1824219226837158,
"logps/chosen": -381.67498779296875,
"logps/rejected": -514.7999877929688,
"loss": 0.0057,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.836718797683716,
"rewards/margins": 15.743749618530273,
"rewards/rejected": -18.587499618530273,
"step": 6140
},
{
"epoch": 2.63855809462504,
"grad_norm": 0.5625709514809482,
"learning_rate": 3.402360515021459e-07,
"logits/chosen": -1.11376953125,
"logits/rejected": -1.169531226158142,
"logps/chosen": -427.375,
"logps/rejected": -571.2000122070312,
"loss": 0.0004,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.221057176589966,
"rewards/margins": 16.440624237060547,
"rewards/rejected": -19.667186737060547,
"step": 6150
},
{
"epoch": 2.6428494796695636,
"grad_norm": 0.03841319460093605,
"learning_rate": 3.391630901287553e-07,
"logits/chosen": -1.087915062904358,
"logits/rejected": -1.084863305091858,
"logps/chosen": -367.1000061035156,
"logps/rejected": -536.0,
"loss": 0.0143,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.4153809547424316,
"rewards/margins": 18.2265625,
"rewards/rejected": -21.640625,
"step": 6160
},
{
"epoch": 2.6471408647140864,
"grad_norm": 0.04919708597642205,
"learning_rate": 3.380901287553648e-07,
"logits/chosen": -1.2096679210662842,
"logits/rejected": -1.2317383289337158,
"logps/chosen": -422.20001220703125,
"logps/rejected": -544.6500244140625,
"loss": 0.0055,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.257714748382568,
"rewards/margins": 16.329687118530273,
"rewards/rejected": -20.595312118530273,
"step": 6170
},
{
"epoch": 2.6514322497586096,
"grad_norm": 0.2859959319544514,
"learning_rate": 3.370171673819742e-07,
"logits/chosen": -1.0998046398162842,
"logits/rejected": -1.1304199695587158,
"logps/chosen": -375.70001220703125,
"logps/rejected": -502.04998779296875,
"loss": 0.0095,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.2306151390075684,
"rewards/margins": 16.634374618530273,
"rewards/rejected": -19.871875762939453,
"step": 6180
},
{
"epoch": 2.655723634803133,
"grad_norm": 1.5862905027322383,
"learning_rate": 3.359442060085837e-07,
"logits/chosen": -1.22998046875,
"logits/rejected": -1.2902343273162842,
"logps/chosen": -394.7250061035156,
"logps/rejected": -556.4000244140625,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.377172946929932,
"rewards/margins": 17.848438262939453,
"rewards/rejected": -22.225000381469727,
"step": 6190
},
{
"epoch": 2.660015019847656,
"grad_norm": 0.12713119445498408,
"learning_rate": 3.348712446351931e-07,
"logits/chosen": -1.2356445789337158,
"logits/rejected": -1.3152344226837158,
"logps/chosen": -454.70001220703125,
"logps/rejected": -576.2999877929688,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.132843017578125,
"rewards/margins": 17.606250762939453,
"rewards/rejected": -21.746875762939453,
"step": 6200
},
{
"epoch": 2.664306404892179,
"grad_norm": 1.9771307577383137,
"learning_rate": 3.3379828326180253e-07,
"logits/chosen": -1.0989258289337158,
"logits/rejected": -1.1527831554412842,
"logps/chosen": -405.8999938964844,
"logps/rejected": -577.25,
"loss": 0.033,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.186327934265137,
"rewards/margins": 17.9609375,
"rewards/rejected": -22.149999618530273,
"step": 6210
},
{
"epoch": 2.668597789936702,
"grad_norm": 0.3739970249160375,
"learning_rate": 3.32725321888412e-07,
"logits/chosen": -1.1715087890625,
"logits/rejected": -1.2533690929412842,
"logps/chosen": -415.875,
"logps/rejected": -545.9000244140625,
"loss": 0.0189,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.358788967132568,
"rewards/margins": 15.454687118530273,
"rewards/rejected": -19.818750381469727,
"step": 6220
},
{
"epoch": 2.672889174981225,
"grad_norm": 0.028976249331164185,
"learning_rate": 3.316523605150214e-07,
"logits/chosen": -1.175683617591858,
"logits/rejected": -1.2211425304412842,
"logps/chosen": -392.75,
"logps/rejected": -565.0499877929688,
"loss": 0.0133,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.058007717132568,
"rewards/margins": 17.690624237060547,
"rewards/rejected": -21.740625381469727,
"step": 6230
},
{
"epoch": 2.6771805600257483,
"grad_norm": 6.042038606435633,
"learning_rate": 3.305793991416309e-07,
"logits/chosen": -1.2159926891326904,
"logits/rejected": -1.249017357826233,
"logps/chosen": -383.70001220703125,
"logps/rejected": -551.0999755859375,
"loss": 0.0026,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.5869140625,
"rewards/margins": 18.411718368530273,
"rewards/rejected": -22.004688262939453,
"step": 6240
},
{
"epoch": 2.6814719450702715,
"grad_norm": 2.442412286141214,
"learning_rate": 3.2950643776824034e-07,
"logits/chosen": -1.1765625476837158,
"logits/rejected": -1.2177734375,
"logps/chosen": -409.0562438964844,
"logps/rejected": -518.375,
"loss": 0.0051,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.406445264816284,
"rewards/margins": 15.860937118530273,
"rewards/rejected": -19.267187118530273,
"step": 6250
},
{
"epoch": 2.6857633301147947,
"grad_norm": 0.18297352062757927,
"learning_rate": 3.2843347639484975e-07,
"logits/chosen": -1.121972680091858,
"logits/rejected": -1.1828124523162842,
"logps/chosen": -432.2250061035156,
"logps/rejected": -546.9500122070312,
"loss": 0.0189,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.041259765625,
"rewards/margins": 16.928125381469727,
"rewards/rejected": -21.96875,
"step": 6260
},
{
"epoch": 2.6900547151593175,
"grad_norm": 0.14983124242754417,
"learning_rate": 3.273605150214592e-07,
"logits/chosen": -1.139794945716858,
"logits/rejected": -1.1677734851837158,
"logps/chosen": -416.82501220703125,
"logps/rejected": -573.5499877929688,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.692065477371216,
"rewards/margins": 17.765625,
"rewards/rejected": -21.462499618530273,
"step": 6270
},
{
"epoch": 2.6943461002038407,
"grad_norm": 0.2511333057878584,
"learning_rate": 3.262875536480686e-07,
"logits/chosen": -1.1207275390625,
"logits/rejected": -1.1764647960662842,
"logps/chosen": -416.20001220703125,
"logps/rejected": -573.9500122070312,
"loss": 0.0073,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.306445121765137,
"rewards/margins": 16.901561737060547,
"rewards/rejected": -22.223438262939453,
"step": 6280
},
{
"epoch": 2.698637485248364,
"grad_norm": 0.017253096173398912,
"learning_rate": 3.2521459227467814e-07,
"logits/chosen": -1.1545898914337158,
"logits/rejected": -1.2039062976837158,
"logps/chosen": -420.07501220703125,
"logps/rejected": -558.5,
"loss": 0.0007,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.107079982757568,
"rewards/margins": 18.3984375,
"rewards/rejected": -22.493749618530273,
"step": 6290
},
{
"epoch": 2.702928870292887,
"grad_norm": 0.16407107375088972,
"learning_rate": 3.2414163090128755e-07,
"logits/chosen": -1.1139647960662842,
"logits/rejected": -1.1533691883087158,
"logps/chosen": -381.95001220703125,
"logps/rejected": -531.4000244140625,
"loss": 0.0163,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.0899415016174316,
"rewards/margins": 17.757030487060547,
"rewards/rejected": -20.839061737060547,
"step": 6300
},
{
"epoch": 2.7072202553374103,
"grad_norm": 1.558264793866727,
"learning_rate": 3.2306866952789696e-07,
"logits/chosen": -1.1912841796875,
"logits/rejected": -1.2086181640625,
"logps/chosen": -424.6875,
"logps/rejected": -578.4000244140625,
"loss": 0.0098,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.8907227516174316,
"rewards/margins": 17.623437881469727,
"rewards/rejected": -21.514062881469727,
"step": 6310
},
{
"epoch": 2.711511640381933,
"grad_norm": 0.12449114444918907,
"learning_rate": 3.219957081545064e-07,
"logits/chosen": -1.0435791015625,
"logits/rejected": -1.1114501953125,
"logps/chosen": -389.0,
"logps/rejected": -517.4500122070312,
"loss": 0.0175,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.762793064117432,
"rewards/margins": 17.571874618530273,
"rewards/rejected": -22.345312118530273,
"step": 6320
},
{
"epoch": 2.7158030254264562,
"grad_norm": 0.341440573494519,
"learning_rate": 3.2092274678111584e-07,
"logits/chosen": -1.094970703125,
"logits/rejected": -1.14208984375,
"logps/chosen": -343.95001220703125,
"logps/rejected": -492.1499938964844,
"loss": 0.0166,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.232324123382568,
"rewards/margins": 16.479686737060547,
"rewards/rejected": -20.714061737060547,
"step": 6330
},
{
"epoch": 2.7200944104709794,
"grad_norm": 0.7303841002564108,
"learning_rate": 3.198497854077253e-07,
"logits/chosen": -1.0439453125,
"logits/rejected": -1.110693335533142,
"logps/chosen": -396.25,
"logps/rejected": -521.5499877929688,
"loss": 0.0161,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.961669921875,
"rewards/margins": 16.139062881469727,
"rewards/rejected": -20.104686737060547,
"step": 6340
},
{
"epoch": 2.7243857955155026,
"grad_norm": 5.695949385887621,
"learning_rate": 3.1877682403433476e-07,
"logits/chosen": -1.0993835926055908,
"logits/rejected": -1.168359398841858,
"logps/chosen": -389.125,
"logps/rejected": -515.8499755859375,
"loss": 0.0053,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.613037109375,
"rewards/margins": 15.879687309265137,
"rewards/rejected": -18.4921875,
"step": 6350
},
{
"epoch": 2.728677180560026,
"grad_norm": 0.30767965365017286,
"learning_rate": 3.177038626609442e-07,
"logits/chosen": -1.146875023841858,
"logits/rejected": -1.176049828529358,
"logps/chosen": -418.5,
"logps/rejected": -559.2000122070312,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.7760252952575684,
"rewards/margins": 17.5546875,
"rewards/rejected": -21.331249237060547,
"step": 6360
},
{
"epoch": 2.7329685656045486,
"grad_norm": 0.2511619576486326,
"learning_rate": 3.1663090128755364e-07,
"logits/chosen": -1.062890648841858,
"logits/rejected": -1.1300780773162842,
"logps/chosen": -379.7250061035156,
"logps/rejected": -504.75,
"loss": 0.0196,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.916796922683716,
"rewards/margins": 16.706249237060547,
"rewards/rejected": -19.635936737060547,
"step": 6370
},
{
"epoch": 2.7372599506490722,
"grad_norm": 2.5712852046523103,
"learning_rate": 3.1555793991416305e-07,
"logits/chosen": -1.114648461341858,
"logits/rejected": -1.174951195716858,
"logps/chosen": -399.9750061035156,
"logps/rejected": -506.67498779296875,
"loss": 0.0186,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.8543944358825684,
"rewards/margins": 14.822656631469727,
"rewards/rejected": -18.676563262939453,
"step": 6380
},
{
"epoch": 2.741551335693595,
"grad_norm": 58.23191231248602,
"learning_rate": 3.144849785407725e-07,
"logits/chosen": -1.143310546875,
"logits/rejected": -1.168359398841858,
"logps/chosen": -407.125,
"logps/rejected": -522.0,
"loss": 0.0179,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.79833984375,
"rewards/margins": 17.501562118530273,
"rewards/rejected": -21.295312881469727,
"step": 6390
},
{
"epoch": 2.745842720738118,
"grad_norm": 0.665111643510761,
"learning_rate": 3.13412017167382e-07,
"logits/chosen": -1.10693359375,
"logits/rejected": -1.1408202648162842,
"logps/chosen": -384.3500061035156,
"logps/rejected": -530.0250244140625,
"loss": 0.0005,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.323779106140137,
"rewards/margins": 16.717187881469727,
"rewards/rejected": -21.037500381469727,
"step": 6400
},
{
"epoch": 2.7501341057826414,
"grad_norm": 0.017159448941161805,
"learning_rate": 3.123390557939914e-07,
"logits/chosen": -1.1697266101837158,
"logits/rejected": -1.212988257408142,
"logps/chosen": -472.4750061035156,
"logps/rejected": -624.2000122070312,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.854199171066284,
"rewards/margins": 17.709375381469727,
"rewards/rejected": -21.565624237060547,
"step": 6410
},
{
"epoch": 2.7544254908271646,
"grad_norm": 0.2467001773901379,
"learning_rate": 3.1126609442060085e-07,
"logits/chosen": -1.136132836341858,
"logits/rejected": -1.1658446788787842,
"logps/chosen": -444.8999938964844,
"logps/rejected": -580.0499877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.6280274391174316,
"rewards/margins": 18.415624618530273,
"rewards/rejected": -22.043750762939453,
"step": 6420
},
{
"epoch": 2.758716875871688,
"grad_norm": 1.7631911531526012,
"learning_rate": 3.1019313304721026e-07,
"logits/chosen": -1.027856469154358,
"logits/rejected": -1.086035132408142,
"logps/chosen": -378.0249938964844,
"logps/rejected": -539.9000244140625,
"loss": 0.0133,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.9754881858825684,
"rewards/margins": 17.1484375,
"rewards/rejected": -21.1328125,
"step": 6430
},
{
"epoch": 2.7630082609162105,
"grad_norm": 70.40410095025409,
"learning_rate": 3.0912017167381973e-07,
"logits/chosen": -1.1338379383087158,
"logits/rejected": -1.1833984851837158,
"logps/chosen": -415.32501220703125,
"logps/rejected": -554.0,
"loss": 0.0044,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.824316501617432,
"rewards/margins": 17.120311737060547,
"rewards/rejected": -21.9453125,
"step": 6440
},
{
"epoch": 2.7672996459607337,
"grad_norm": 0.6695117155853282,
"learning_rate": 3.080472103004292e-07,
"logits/chosen": -1.067724585533142,
"logits/rejected": -1.0922362804412842,
"logps/chosen": -398.29998779296875,
"logps/rejected": -550.5250244140625,
"loss": 0.0317,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -4.178808689117432,
"rewards/margins": 17.3671875,
"rewards/rejected": -21.548437118530273,
"step": 6450
},
{
"epoch": 2.771591031005257,
"grad_norm": 0.13602896704869735,
"learning_rate": 3.069742489270386e-07,
"logits/chosen": -1.153222680091858,
"logits/rejected": -1.1833007335662842,
"logps/chosen": -396.5,
"logps/rejected": -548.0499877929688,
"loss": 0.0103,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.59136962890625,
"rewards/margins": 17.310937881469727,
"rewards/rejected": -21.896875381469727,
"step": 6460
},
{
"epoch": 2.77588241604978,
"grad_norm": 0.2400847824783146,
"learning_rate": 3.0590128755364807e-07,
"logits/chosen": -1.1359131336212158,
"logits/rejected": -1.168115258216858,
"logps/chosen": -408.7250061035156,
"logps/rejected": -523.75,
"loss": 0.0176,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.640869140625,
"rewards/margins": 17.017187118530273,
"rewards/rejected": -19.659374237060547,
"step": 6470
},
{
"epoch": 2.7801738010943033,
"grad_norm": 4.830861868678675,
"learning_rate": 3.048283261802575e-07,
"logits/chosen": -1.1575195789337158,
"logits/rejected": -1.202050805091858,
"logps/chosen": -391.75,
"logps/rejected": -537.7999877929688,
"loss": 0.0056,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.327099561691284,
"rewards/margins": 16.549999237060547,
"rewards/rejected": -19.879688262939453,
"step": 6480
},
{
"epoch": 2.784465186138826,
"grad_norm": 0.04358226587651279,
"learning_rate": 3.0375536480686694e-07,
"logits/chosen": -1.1005859375,
"logits/rejected": -1.18115234375,
"logps/chosen": -406.7250061035156,
"logps/rejected": -519.2750244140625,
"loss": 0.0156,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.890429735183716,
"rewards/margins": 16.075780868530273,
"rewards/rejected": -18.954687118530273,
"step": 6490
},
{
"epoch": 2.7887565711833493,
"grad_norm": 0.4869708208903308,
"learning_rate": 3.026824034334764e-07,
"logits/chosen": -1.068457007408142,
"logits/rejected": -1.147851586341858,
"logps/chosen": -372.125,
"logps/rejected": -527.2999877929688,
"loss": 0.0096,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.4208984375,
"rewards/margins": 15.40625,
"rewards/rejected": -18.818750381469727,
"step": 6500
},
{
"epoch": 2.7930479562278725,
"grad_norm": 0.06855429348751023,
"learning_rate": 3.016094420600858e-07,
"logits/chosen": -1.082910180091858,
"logits/rejected": -1.116601586341858,
"logps/chosen": -391.95001220703125,
"logps/rejected": -525.2000122070312,
"loss": 0.0102,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.1814942359924316,
"rewards/margins": 15.925000190734863,
"rewards/rejected": -19.09375,
"step": 6510
},
{
"epoch": 2.7973393412723957,
"grad_norm": 4.136598653759272,
"learning_rate": 3.005364806866953e-07,
"logits/chosen": -1.0823974609375,
"logits/rejected": -1.117285132408142,
"logps/chosen": -394.1499938964844,
"logps/rejected": -549.5499877929688,
"loss": 0.0092,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.1749024391174316,
"rewards/margins": 16.801563262939453,
"rewards/rejected": -19.975000381469727,
"step": 6520
},
{
"epoch": 2.801630726316919,
"grad_norm": 0.43694777915440336,
"learning_rate": 2.994635193133047e-07,
"logits/chosen": -1.023950219154358,
"logits/rejected": -1.0615723133087158,
"logps/chosen": -383.7250061035156,
"logps/rejected": -529.2999877929688,
"loss": 0.0105,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.732421875,
"rewards/margins": 16.376562118530273,
"rewards/rejected": -19.104686737060547,
"step": 6530
},
{
"epoch": 2.8059221113614417,
"grad_norm": 2.0686457624070194,
"learning_rate": 2.9839055793991416e-07,
"logits/chosen": -1.1383788585662842,
"logits/rejected": -1.188720703125,
"logps/chosen": -429.5874938964844,
"logps/rejected": -560.9500122070312,
"loss": 0.0098,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.555889844894409,
"rewards/margins": 17.006250381469727,
"rewards/rejected": -20.556249618530273,
"step": 6540
},
{
"epoch": 2.8102134964059653,
"grad_norm": 5.025792322520393,
"learning_rate": 2.973175965665236e-07,
"logits/chosen": -1.0822021961212158,
"logits/rejected": -1.1461913585662842,
"logps/chosen": -429.1499938964844,
"logps/rejected": -612.1500244140625,
"loss": 0.0092,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.9110350608825684,
"rewards/margins": 18.051563262939453,
"rewards/rejected": -21.959375381469727,
"step": 6550
},
{
"epoch": 2.814504881450488,
"grad_norm": 0.26008114539563354,
"learning_rate": 2.9624463519313303e-07,
"logits/chosen": -1.085302710533142,
"logits/rejected": -1.118408203125,
"logps/chosen": -372.1000061035156,
"logps/rejected": -501.20001220703125,
"loss": 0.0132,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.851733446121216,
"rewards/margins": 16.317188262939453,
"rewards/rejected": -20.1796875,
"step": 6560
},
{
"epoch": 2.8187962664950112,
"grad_norm": 0.03320099176764248,
"learning_rate": 2.9517167381974244e-07,
"logits/chosen": -1.1650390625,
"logits/rejected": -1.193945288658142,
"logps/chosen": -429.0249938964844,
"logps/rejected": -555.6500244140625,
"loss": 0.0052,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.8432250022888184,
"rewards/margins": 16.301563262939453,
"rewards/rejected": -20.145313262939453,
"step": 6570
},
{
"epoch": 2.8230876515395344,
"grad_norm": 34.29849607949799,
"learning_rate": 2.940987124463519e-07,
"logits/chosen": -1.01708984375,
"logits/rejected": -1.067968726158142,
"logps/chosen": -396.17498779296875,
"logps/rejected": -539.25,
"loss": 0.0121,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.326709032058716,
"rewards/margins": 16.581249237060547,
"rewards/rejected": -19.909374237060547,
"step": 6580
},
{
"epoch": 2.8273790365840576,
"grad_norm": 0.31172731006123194,
"learning_rate": 2.9302575107296137e-07,
"logits/chosen": -0.9941161870956421,
"logits/rejected": -1.0595214366912842,
"logps/chosen": -410.8500061035156,
"logps/rejected": -577.9500122070312,
"loss": 0.0119,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.6103515625,
"rewards/margins": 17.4765625,
"rewards/rejected": -22.076562881469727,
"step": 6590
},
{
"epoch": 2.831670421628581,
"grad_norm": 0.04453226691016711,
"learning_rate": 2.9195278969957083e-07,
"logits/chosen": -1.1447265148162842,
"logits/rejected": -1.1728026866912842,
"logps/chosen": -422.9750061035156,
"logps/rejected": -582.5499877929688,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.27734375,
"rewards/margins": 17.201562881469727,
"rewards/rejected": -21.481250762939453,
"step": 6600
},
{
"epoch": 2.8359618066731036,
"grad_norm": 1.2485162350807397,
"learning_rate": 2.9087982832618024e-07,
"logits/chosen": -1.0518798828125,
"logits/rejected": -1.110742211341858,
"logps/chosen": -387.8500061035156,
"logps/rejected": -543.2000122070312,
"loss": 0.0258,
"rewards/accuracies": 0.96875,
"rewards/chosen": -4.219042778015137,
"rewards/margins": 17.857812881469727,
"rewards/rejected": -22.087499618530273,
"step": 6610
},
{
"epoch": 2.840253191717627,
"grad_norm": 0.008505312707248821,
"learning_rate": 2.8980686695278966e-07,
"logits/chosen": -1.045263648033142,
"logits/rejected": -1.122460961341858,
"logps/chosen": -376.45001220703125,
"logps/rejected": -545.6500244140625,
"loss": 0.0119,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.165429592132568,
"rewards/margins": 17.6640625,
"rewards/rejected": -21.828125,
"step": 6620
},
{
"epoch": 2.84454457676215,
"grad_norm": 2.1274236494928322,
"learning_rate": 2.887339055793991e-07,
"logits/chosen": -1.119287133216858,
"logits/rejected": -1.1335937976837158,
"logps/chosen": -409.0,
"logps/rejected": -553.9000244140625,
"loss": 0.0027,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.054858446121216,
"rewards/margins": 17.3359375,
"rewards/rejected": -20.395313262939453,
"step": 6630
},
{
"epoch": 2.848835961806673,
"grad_norm": 0.012997654048413913,
"learning_rate": 2.876609442060086e-07,
"logits/chosen": -1.1417968273162842,
"logits/rejected": -1.188378930091858,
"logps/chosen": -426.95001220703125,
"logps/rejected": -586.5499877929688,
"loss": 0.0056,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.531787157058716,
"rewards/margins": 16.921875,
"rewards/rejected": -20.456249237060547,
"step": 6640
},
{
"epoch": 2.8531273468511964,
"grad_norm": 1.8249718185823771,
"learning_rate": 2.8658798283261805e-07,
"logits/chosen": -1.0469238758087158,
"logits/rejected": -1.085107445716858,
"logps/chosen": -404.4750061035156,
"logps/rejected": -527.3499755859375,
"loss": 0.0092,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.287029981613159,
"rewards/margins": 16.4453125,
"rewards/rejected": -19.740625381469727,
"step": 6650
},
{
"epoch": 2.857418731895719,
"grad_norm": 0.8605487912386847,
"learning_rate": 2.8551502145922746e-07,
"logits/chosen": -1.1165282726287842,
"logits/rejected": -1.1824219226837158,
"logps/chosen": -423.54998779296875,
"logps/rejected": -592.25,
"loss": 0.0003,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.170703172683716,
"rewards/margins": 18.498437881469727,
"rewards/rejected": -21.654687881469727,
"step": 6660
},
{
"epoch": 2.8617101169402424,
"grad_norm": 0.17847628219851697,
"learning_rate": 2.8444206008583687e-07,
"logits/chosen": -1.138281226158142,
"logits/rejected": -1.20849609375,
"logps/chosen": -421.8999938964844,
"logps/rejected": -537.1500244140625,
"loss": 0.0151,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.1214842796325684,
"rewards/margins": 16.09765625,
"rewards/rejected": -19.217187881469727,
"step": 6670
},
{
"epoch": 2.8660015019847656,
"grad_norm": 5.383701900903623,
"learning_rate": 2.8336909871244633e-07,
"logits/chosen": -1.065155029296875,
"logits/rejected": -1.1383056640625,
"logps/chosen": -370.625,
"logps/rejected": -514.4500122070312,
"loss": 0.014,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.181835889816284,
"rewards/margins": 16.375,
"rewards/rejected": -19.559375762939453,
"step": 6680
},
{
"epoch": 2.8702928870292888,
"grad_norm": 2.317468571147531,
"learning_rate": 2.822961373390558e-07,
"logits/chosen": -1.126074194908142,
"logits/rejected": -1.165429711341858,
"logps/chosen": -385.875,
"logps/rejected": -554.5499877929688,
"loss": 0.0282,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.4695801734924316,
"rewards/margins": 16.42578125,
"rewards/rejected": -19.892187118530273,
"step": 6690
},
{
"epoch": 2.874584272073812,
"grad_norm": 0.03680714788548126,
"learning_rate": 2.8122317596566526e-07,
"logits/chosen": -1.092382788658142,
"logits/rejected": -1.110815405845642,
"logps/chosen": -386.875,
"logps/rejected": -531.75,
"loss": 0.0131,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.378002882003784,
"rewards/margins": 16.982812881469727,
"rewards/rejected": -20.353124618530273,
"step": 6700
},
{
"epoch": 2.8788756571183347,
"grad_norm": 33.476581892084894,
"learning_rate": 2.8015021459227467e-07,
"logits/chosen": -1.149804711341858,
"logits/rejected": -1.1837890148162842,
"logps/chosen": -392.2250061035156,
"logps/rejected": -551.6500244140625,
"loss": 0.0198,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.8650574684143066,
"rewards/margins": 17.654687881469727,
"rewards/rejected": -21.5234375,
"step": 6710
},
{
"epoch": 2.883167042162858,
"grad_norm": 0.06874988179677158,
"learning_rate": 2.790772532188841e-07,
"logits/chosen": -1.149999976158142,
"logits/rejected": -1.2208740711212158,
"logps/chosen": -392.7875061035156,
"logps/rejected": -532.7249755859375,
"loss": 0.0004,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.7861328125,
"rewards/margins": 16.9921875,
"rewards/rejected": -20.779687881469727,
"step": 6720
},
{
"epoch": 2.887458427207381,
"grad_norm": 0.08190278384087993,
"learning_rate": 2.7800429184549355e-07,
"logits/chosen": -1.1873047351837158,
"logits/rejected": -1.23095703125,
"logps/chosen": -390.75,
"logps/rejected": -523.2999877929688,
"loss": 0.0151,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.994982957839966,
"rewards/margins": 17.225000381469727,
"rewards/rejected": -20.220312118530273,
"step": 6730
},
{
"epoch": 2.8917498122519043,
"grad_norm": 4.113618173725715,
"learning_rate": 2.76931330472103e-07,
"logits/chosen": -1.0952637195587158,
"logits/rejected": -1.1465332508087158,
"logps/chosen": -382.73748779296875,
"logps/rejected": -543.7000122070312,
"loss": 0.0132,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.748681545257568,
"rewards/margins": 17.623437881469727,
"rewards/rejected": -22.375,
"step": 6740
},
{
"epoch": 2.8960411972964275,
"grad_norm": 0.004131997125234821,
"learning_rate": 2.758583690987124e-07,
"logits/chosen": -1.1780273914337158,
"logits/rejected": -1.210546851158142,
"logps/chosen": -387.4750061035156,
"logps/rejected": -551.5499877929688,
"loss": 0.0092,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.230761528015137,
"rewards/margins": 17.21875,
"rewards/rejected": -23.462499618530273,
"step": 6750
},
{
"epoch": 2.9003325823409507,
"grad_norm": 0.10287402224650052,
"learning_rate": 2.747854077253219e-07,
"logits/chosen": -1.159570336341858,
"logits/rejected": -1.193750023841858,
"logps/chosen": -402.1625061035156,
"logps/rejected": -575.8499755859375,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.483838081359863,
"rewards/margins": 17.2890625,
"rewards/rejected": -22.762500762939453,
"step": 6760
},
{
"epoch": 2.904623967385474,
"grad_norm": 0.2387039663589461,
"learning_rate": 2.737124463519313e-07,
"logits/chosen": -1.1859619617462158,
"logits/rejected": -1.1893310546875,
"logps/chosen": -410.1499938964844,
"logps/rejected": -551.4500122070312,
"loss": 0.0063,
"rewards/accuracies": 1.0,
"rewards/chosen": -6.254492282867432,
"rewards/margins": 17.832813262939453,
"rewards/rejected": -24.0703125,
"step": 6770
},
{
"epoch": 2.9089153524299967,
"grad_norm": 0.0007330988858735252,
"learning_rate": 2.7263948497854076e-07,
"logits/chosen": -1.0857422351837158,
"logits/rejected": -1.140869140625,
"logps/chosen": -403.8500061035156,
"logps/rejected": -552.75,
"loss": 0.0223,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.592577934265137,
"rewards/margins": 18.423437118530273,
"rewards/rejected": -24.018749237060547,
"step": 6780
},
{
"epoch": 2.91320673747452,
"grad_norm": 0.12279139603402796,
"learning_rate": 2.715665236051502e-07,
"logits/chosen": -1.043798804283142,
"logits/rejected": -1.1020996570587158,
"logps/chosen": -390.2124938964844,
"logps/rejected": -557.5750122070312,
"loss": 0.0191,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.569140434265137,
"rewards/margins": 16.880468368530273,
"rewards/rejected": -22.459375381469727,
"step": 6790
},
{
"epoch": 2.917498122519043,
"grad_norm": 1.833745751437381,
"learning_rate": 2.7049356223175964e-07,
"logits/chosen": -1.106835961341858,
"logits/rejected": -1.203466773033142,
"logps/chosen": -435.5,
"logps/rejected": -554.0999755859375,
"loss": 0.0135,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.113671779632568,
"rewards/margins": 17.121875762939453,
"rewards/rejected": -22.2421875,
"step": 6800
},
{
"epoch": 2.9217895075635663,
"grad_norm": 0.04453613121689767,
"learning_rate": 2.694206008583691e-07,
"logits/chosen": -1.107666015625,
"logits/rejected": -1.173486351966858,
"logps/chosen": -428.92498779296875,
"logps/rejected": -598.2999877929688,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.703222751617432,
"rewards/margins": 18.464061737060547,
"rewards/rejected": -24.176563262939453,
"step": 6810
},
{
"epoch": 2.9260808926080895,
"grad_norm": 0.016320720718881864,
"learning_rate": 2.683476394849785e-07,
"logits/chosen": -1.0830078125,
"logits/rejected": -1.141015648841858,
"logps/chosen": -398.8999938964844,
"logps/rejected": -576.25,
"loss": 0.0176,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.218457221984863,
"rewards/margins": 20.004688262939453,
"rewards/rejected": -25.228124618530273,
"step": 6820
},
{
"epoch": 2.930372277652612,
"grad_norm": 0.11404054228480617,
"learning_rate": 2.67274678111588e-07,
"logits/chosen": -1.0846068859100342,
"logits/rejected": -1.1232178211212158,
"logps/chosen": -445.7749938964844,
"logps/rejected": -590.5,
"loss": 0.0344,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -4.5947265625,
"rewards/margins": 18.526561737060547,
"rewards/rejected": -23.1328125,
"step": 6830
},
{
"epoch": 2.9346636626971354,
"grad_norm": 0.23925849581562467,
"learning_rate": 2.6620171673819744e-07,
"logits/chosen": -1.126953125,
"logits/rejected": -1.169189453125,
"logps/chosen": -401.625,
"logps/rejected": -567.0999755859375,
"loss": 0.0223,
"rewards/accuracies": 0.96875,
"rewards/chosen": -4.591064453125,
"rewards/margins": 18.154687881469727,
"rewards/rejected": -22.732812881469727,
"step": 6840
},
{
"epoch": 2.9389550477416586,
"grad_norm": 0.07021392546832039,
"learning_rate": 2.6512875536480685e-07,
"logits/chosen": -1.1106445789337158,
"logits/rejected": -1.0964844226837158,
"logps/chosen": -381.5,
"logps/rejected": -550.0499877929688,
"loss": 0.0134,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.954174995422363,
"rewards/margins": 17.379688262939453,
"rewards/rejected": -22.326562881469727,
"step": 6850
},
{
"epoch": 2.943246432786182,
"grad_norm": 0.5872394867884444,
"learning_rate": 2.640557939914163e-07,
"logits/chosen": -0.970440685749054,
"logits/rejected": -1.053491234779358,
"logps/chosen": -389.79998779296875,
"logps/rejected": -540.0,
"loss": 0.0225,
"rewards/accuracies": 0.96875,
"rewards/chosen": -4.573828220367432,
"rewards/margins": 16.6640625,
"rewards/rejected": -21.235937118530273,
"step": 6860
},
{
"epoch": 2.947537817830705,
"grad_norm": 1.8932138624054262,
"learning_rate": 2.629828326180257e-07,
"logits/chosen": -1.070654273033142,
"logits/rejected": -1.08984375,
"logps/chosen": -367.7875061035156,
"logps/rejected": -549.9000244140625,
"loss": 0.0027,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.888842821121216,
"rewards/margins": 17.149999618530273,
"rewards/rejected": -21.037500381469727,
"step": 6870
},
{
"epoch": 2.9518292028752278,
"grad_norm": 0.27225482651235966,
"learning_rate": 2.619098712446352e-07,
"logits/chosen": -0.9581543207168579,
"logits/rejected": -1.0140380859375,
"logps/chosen": -372.8125,
"logps/rejected": -519.5499877929688,
"loss": 0.0133,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.935961961746216,
"rewards/margins": 17.8671875,
"rewards/rejected": -20.803125381469727,
"step": 6880
},
{
"epoch": 2.956120587919751,
"grad_norm": 0.07832943803901476,
"learning_rate": 2.6083690987124465e-07,
"logits/chosen": -1.066748023033142,
"logits/rejected": -1.119726538658142,
"logps/chosen": -376.4750061035156,
"logps/rejected": -542.9000244140625,
"loss": 0.003,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.11328125,
"rewards/margins": 17.442188262939453,
"rewards/rejected": -20.5546875,
"step": 6890
},
{
"epoch": 2.960411972964274,
"grad_norm": 1.316772707856467,
"learning_rate": 2.5976394849785406e-07,
"logits/chosen": -0.922607421875,
"logits/rejected": -0.977832019329071,
"logps/chosen": -425.1875,
"logps/rejected": -580.75,
"loss": 0.0248,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.806640625,
"rewards/margins": 18.154687881469727,
"rewards/rejected": -21.953125,
"step": 6900
},
{
"epoch": 2.9647033580087974,
"grad_norm": 0.626242401926231,
"learning_rate": 2.5869098712446353e-07,
"logits/chosen": -1.0491454601287842,
"logits/rejected": -1.070898413658142,
"logps/chosen": -418.54998779296875,
"logps/rejected": -586.75,
"loss": 0.0061,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.499072074890137,
"rewards/margins": 18.095312118530273,
"rewards/rejected": -22.59375,
"step": 6910
},
{
"epoch": 2.9689947430533206,
"grad_norm": 0.44346695692015714,
"learning_rate": 2.5761802575107294e-07,
"logits/chosen": -1.0969970226287842,
"logits/rejected": -1.1124999523162842,
"logps/chosen": -389.17498779296875,
"logps/rejected": -517.5499877929688,
"loss": 0.0217,
"rewards/accuracies": 0.96875,
"rewards/chosen": -4.229687690734863,
"rewards/margins": 16.91796875,
"rewards/rejected": -21.1328125,
"step": 6920
},
{
"epoch": 2.9732861280978433,
"grad_norm": 0.0032791312752799245,
"learning_rate": 2.565450643776824e-07,
"logits/chosen": -1.0750000476837158,
"logits/rejected": -1.0897216796875,
"logps/chosen": -411.8500061035156,
"logps/rejected": -553.7000122070312,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.692675590515137,
"rewards/margins": 18.251562118530273,
"rewards/rejected": -22.9453125,
"step": 6930
},
{
"epoch": 2.977577513142367,
"grad_norm": 0.12538616889953105,
"learning_rate": 2.554721030042918e-07,
"logits/chosen": -1.127343773841858,
"logits/rejected": -1.1511719226837158,
"logps/chosen": -413.67498779296875,
"logps/rejected": -540.5499877929688,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.697070121765137,
"rewards/margins": 18.431249618530273,
"rewards/rejected": -23.121875762939453,
"step": 6940
},
{
"epoch": 2.9818688981868897,
"grad_norm": 12.361835458938065,
"learning_rate": 2.543991416309013e-07,
"logits/chosen": -0.992388904094696,
"logits/rejected": -1.0128662586212158,
"logps/chosen": -429.32501220703125,
"logps/rejected": -545.3499755859375,
"loss": 0.0461,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.654394626617432,
"rewards/margins": 16.424219131469727,
"rewards/rejected": -21.089061737060547,
"step": 6950
},
{
"epoch": 2.986160283231413,
"grad_norm": 0.44444414662920156,
"learning_rate": 2.5332618025751074e-07,
"logits/chosen": -0.9417968988418579,
"logits/rejected": -0.9969238042831421,
"logps/chosen": -436.625,
"logps/rejected": -599.7000122070312,
"loss": 0.016,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.56640625,
"rewards/margins": 18.0234375,
"rewards/rejected": -22.590625762939453,
"step": 6960
},
{
"epoch": 2.990451668275936,
"grad_norm": 0.6637141361142552,
"learning_rate": 2.5225321888412015e-07,
"logits/chosen": -1.0317871570587158,
"logits/rejected": -1.1255371570587158,
"logps/chosen": -413.6000061035156,
"logps/rejected": -568.1500244140625,
"loss": 0.0061,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.749218940734863,
"rewards/margins": 17.642187118530273,
"rewards/rejected": -22.378124237060547,
"step": 6970
},
{
"epoch": 2.9947430533204593,
"grad_norm": 0.4310314072784117,
"learning_rate": 2.5118025751072956e-07,
"logits/chosen": -0.8998168706893921,
"logits/rejected": -0.9791625738143921,
"logps/chosen": -395.17498779296875,
"logps/rejected": -519.2000122070312,
"loss": 0.0273,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -3.4146971702575684,
"rewards/margins": 15.4453125,
"rewards/rejected": -18.862499237060547,
"step": 6980
},
{
"epoch": 2.9990344383649825,
"grad_norm": 0.169618820490877,
"learning_rate": 2.50107296137339e-07,
"logits/chosen": -1.025292992591858,
"logits/rejected": -1.0778319835662842,
"logps/chosen": -407.70001220703125,
"logps/rejected": -556.2999877929688,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.965087890625,
"rewards/margins": 16.475780487060547,
"rewards/rejected": -20.453125,
"step": 6990
},
{
"epoch": 3.003003969531166,
"grad_norm": 0.012852492794570246,
"learning_rate": 2.490343347639485e-07,
"logits/chosen": -0.9653980135917664,
"logits/rejected": -0.9903663396835327,
"logps/chosen": -365.8513488769531,
"logps/rejected": -534.9189453125,
"loss": 0.0246,
"rewards/accuracies": 0.9662162065505981,
"rewards/chosen": -3.5451066493988037,
"rewards/margins": 16.9577693939209,
"rewards/rejected": -20.508445739746094,
"step": 7000
},
{
"epoch": 3.0072953545756893,
"grad_norm": 0.1883159473286805,
"learning_rate": 2.479613733905579e-07,
"logits/chosen": -0.990039050579071,
"logits/rejected": -1.045800805091858,
"logps/chosen": -409.54998779296875,
"logps/rejected": -574.5,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.3230957984924316,
"rewards/margins": 18.131250381469727,
"rewards/rejected": -21.464061737060547,
"step": 7010
},
{
"epoch": 3.0115867396202125,
"grad_norm": 0.011470425094908726,
"learning_rate": 2.4688841201716737e-07,
"logits/chosen": -1.089941382408142,
"logits/rejected": -1.15966796875,
"logps/chosen": -394.17498779296875,
"logps/rejected": -538.7999877929688,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.173593044281006,
"rewards/margins": 16.142187118530273,
"rewards/rejected": -20.309375762939453,
"step": 7020
},
{
"epoch": 3.0158781246647357,
"grad_norm": 0.004629222547386246,
"learning_rate": 2.4581545064377683e-07,
"logits/chosen": -1.105126976966858,
"logits/rejected": -1.142480492591858,
"logps/chosen": -385.92498779296875,
"logps/rejected": -559.7999877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.8199219703674316,
"rewards/margins": 18.246875762939453,
"rewards/rejected": -22.064062118530273,
"step": 7030
},
{
"epoch": 3.0201695097092585,
"grad_norm": 0.028089961491226577,
"learning_rate": 2.4474248927038624e-07,
"logits/chosen": -0.9541260004043579,
"logits/rejected": -1.01806640625,
"logps/chosen": -386.20001220703125,
"logps/rejected": -528.0999755859375,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.63623046875,
"rewards/margins": 17.573436737060547,
"rewards/rejected": -21.212499618530273,
"step": 7040
},
{
"epoch": 3.0244608947537817,
"grad_norm": 0.04387816172302924,
"learning_rate": 2.436695278969957e-07,
"logits/chosen": -1.0131347179412842,
"logits/rejected": -1.015051245689392,
"logps/chosen": -414.0625,
"logps/rejected": -565.5499877929688,
"loss": 0.0262,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.078320503234863,
"rewards/margins": 17.7578125,
"rewards/rejected": -21.831249237060547,
"step": 7050
},
{
"epoch": 3.028752279798305,
"grad_norm": 0.11957022050492318,
"learning_rate": 2.425965665236051e-07,
"logits/chosen": -1.130273461341858,
"logits/rejected": -1.1540038585662842,
"logps/chosen": -373.07501220703125,
"logps/rejected": -533.5,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.1893310546875,
"rewards/margins": 18.528125762939453,
"rewards/rejected": -21.712499618530273,
"step": 7060
},
{
"epoch": 3.033043664842828,
"grad_norm": 0.018614914745001016,
"learning_rate": 2.415236051502146e-07,
"logits/chosen": -0.995800793170929,
"logits/rejected": -1.003808617591858,
"logps/chosen": -402.6499938964844,
"logps/rejected": -591.4000244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.662353515625,
"rewards/margins": 19.057811737060547,
"rewards/rejected": -23.728124618530273,
"step": 7070
},
{
"epoch": 3.0373350498873513,
"grad_norm": 0.023932764096977484,
"learning_rate": 2.4045064377682404e-07,
"logits/chosen": -1.041259765625,
"logits/rejected": -1.0592772960662842,
"logps/chosen": -403.2250061035156,
"logps/rejected": -553.5999755859375,
"loss": 0.0116,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.921142578125,
"rewards/margins": 18.253124237060547,
"rewards/rejected": -22.173437118530273,
"step": 7080
},
{
"epoch": 3.0416264349318745,
"grad_norm": 0.1572713549294151,
"learning_rate": 2.3937768240343345e-07,
"logits/chosen": -1.0118286609649658,
"logits/rejected": -1.040075659751892,
"logps/chosen": -434.17498779296875,
"logps/rejected": -539.5,
"loss": 0.0045,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.736425876617432,
"rewards/margins": 18.651561737060547,
"rewards/rejected": -23.381250381469727,
"step": 7090
},
{
"epoch": 3.045917819976397,
"grad_norm": 0.003381987283044917,
"learning_rate": 2.383047210300429e-07,
"logits/chosen": -0.9781738519668579,
"logits/rejected": -1.025183081626892,
"logps/chosen": -386.8125,
"logps/rejected": -561.7000122070312,
"loss": 0.0146,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.576025485992432,
"rewards/margins": 18.471874237060547,
"rewards/rejected": -23.048437118530273,
"step": 7100
},
{
"epoch": 3.0502092050209204,
"grad_norm": 0.23883892279216642,
"learning_rate": 2.3723175965665236e-07,
"logits/chosen": -1.079126000404358,
"logits/rejected": -1.1520507335662842,
"logps/chosen": -392.0249938964844,
"logps/rejected": -562.2999877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.73046875,
"rewards/margins": 17.6484375,
"rewards/rejected": -22.375,
"step": 7110
},
{
"epoch": 3.0545005900654436,
"grad_norm": 0.03626367810707846,
"learning_rate": 2.361587982832618e-07,
"logits/chosen": -1.0204346179962158,
"logits/rejected": -1.0711181163787842,
"logps/chosen": -397.70001220703125,
"logps/rejected": -575.0499877929688,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.585888862609863,
"rewards/margins": 18.375,
"rewards/rejected": -22.956249237060547,
"step": 7120
},
{
"epoch": 3.058791975109967,
"grad_norm": 0.8931073983603135,
"learning_rate": 2.3508583690987126e-07,
"logits/chosen": -1.0258300304412842,
"logits/rejected": -1.06005859375,
"logps/chosen": -394.9750061035156,
"logps/rejected": -550.7000122070312,
"loss": 0.0131,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.0218262672424316,
"rewards/margins": 19.142187118530273,
"rewards/rejected": -22.153125762939453,
"step": 7130
},
{
"epoch": 3.06308336015449,
"grad_norm": 381.41618174962065,
"learning_rate": 2.3401287553648067e-07,
"logits/chosen": -1.052636742591858,
"logits/rejected": -1.1193358898162842,
"logps/chosen": -412.57501220703125,
"logps/rejected": -579.4500122070312,
"loss": 0.018,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.893359422683716,
"rewards/margins": 18.348438262939453,
"rewards/rejected": -22.243749618530273,
"step": 7140
},
{
"epoch": 3.0673747451990128,
"grad_norm": 0.007556774507986806,
"learning_rate": 2.329399141630901e-07,
"logits/chosen": -1.105859398841858,
"logits/rejected": -1.1364257335662842,
"logps/chosen": -450.79998779296875,
"logps/rejected": -578.0,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.035119533538818,
"rewards/margins": 17.451562881469727,
"rewards/rejected": -21.473438262939453,
"step": 7150
},
{
"epoch": 3.071666130243536,
"grad_norm": 0.0031212743755631893,
"learning_rate": 2.3186695278969957e-07,
"logits/chosen": -0.997607409954071,
"logits/rejected": -1.0497314929962158,
"logps/chosen": -345.7875061035156,
"logps/rejected": -530.5499877929688,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.4971680641174316,
"rewards/margins": 18.112499237060547,
"rewards/rejected": -21.604686737060547,
"step": 7160
},
{
"epoch": 3.075957515288059,
"grad_norm": 0.0035072063326313675,
"learning_rate": 2.30793991416309e-07,
"logits/chosen": -1.1287109851837158,
"logits/rejected": -1.1774413585662842,
"logps/chosen": -402.2749938964844,
"logps/rejected": -592.4500122070312,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.153515815734863,
"rewards/margins": 19.020313262939453,
"rewards/rejected": -23.181249618530273,
"step": 7170
},
{
"epoch": 3.0802489003325824,
"grad_norm": 0.012461367374791187,
"learning_rate": 2.2972103004291844e-07,
"logits/chosen": -1.0167968273162842,
"logits/rejected": -1.0549805164337158,
"logps/chosen": -381.42498779296875,
"logps/rejected": -546.5,
"loss": 0.0146,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.7808837890625,
"rewards/margins": 18.212499618530273,
"rewards/rejected": -22.0,
"step": 7180
},
{
"epoch": 3.0845402853771056,
"grad_norm": 1.9117107794391355,
"learning_rate": 2.2864806866952788e-07,
"logits/chosen": -0.992950439453125,
"logits/rejected": -1.0628173351287842,
"logps/chosen": -380.95001220703125,
"logps/rejected": -541.7000122070312,
"loss": 0.0216,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.6735596656799316,
"rewards/margins": 17.440624237060547,
"rewards/rejected": -21.120311737060547,
"step": 7190
},
{
"epoch": 3.0888316704216288,
"grad_norm": 0.028919992689791785,
"learning_rate": 2.2757510729613732e-07,
"logits/chosen": -1.079736351966858,
"logits/rejected": -1.138769507408142,
"logps/chosen": -372.0249938964844,
"logps/rejected": -532.25,
"loss": 0.0045,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.756640672683716,
"rewards/margins": 17.485937118530273,
"rewards/rejected": -21.217187881469727,
"step": 7200
},
{
"epoch": 3.0931230554661515,
"grad_norm": 0.07471126535731881,
"learning_rate": 2.2650214592274678e-07,
"logits/chosen": -1.1583983898162842,
"logits/rejected": -1.188085913658142,
"logps/chosen": -407.32501220703125,
"logps/rejected": -533.3499755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.2856383323669434,
"rewards/margins": 18.310937881469727,
"rewards/rejected": -21.600000381469727,
"step": 7210
},
{
"epoch": 3.0974144405106747,
"grad_norm": 0.003378535872630436,
"learning_rate": 2.2542918454935622e-07,
"logits/chosen": -1.05596923828125,
"logits/rejected": -1.1089355945587158,
"logps/chosen": -427.1499938964844,
"logps/rejected": -603.5499877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.6424317359924316,
"rewards/margins": 18.918750762939453,
"rewards/rejected": -22.556249618530273,
"step": 7220
},
{
"epoch": 3.101705825555198,
"grad_norm": 0.19273915535532818,
"learning_rate": 2.2435622317596563e-07,
"logits/chosen": -0.9581543207168579,
"logits/rejected": -0.992053210735321,
"logps/chosen": -387.17498779296875,
"logps/rejected": -549.3499755859375,
"loss": 0.026,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -3.709033250808716,
"rewards/margins": 18.013280868530273,
"rewards/rejected": -21.723438262939453,
"step": 7230
},
{
"epoch": 3.105997210599721,
"grad_norm": 0.04131345163024332,
"learning_rate": 2.232832618025751e-07,
"logits/chosen": -1.099707007408142,
"logits/rejected": -1.1299316883087158,
"logps/chosen": -392.0,
"logps/rejected": -563.9500122070312,
"loss": 0.0187,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.202416896820068,
"rewards/margins": 18.307811737060547,
"rewards/rejected": -22.506250381469727,
"step": 7240
},
{
"epoch": 3.1102885956442443,
"grad_norm": 0.14079651654500058,
"learning_rate": 2.2221030042918453e-07,
"logits/chosen": -1.146093726158142,
"logits/rejected": -1.2034180164337158,
"logps/chosen": -396.7749938964844,
"logps/rejected": -578.4500122070312,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.9156250953674316,
"rewards/margins": 19.290624618530273,
"rewards/rejected": -23.193750381469727,
"step": 7250
},
{
"epoch": 3.1145799806887675,
"grad_norm": 1.209043460456609,
"learning_rate": 2.21137339055794e-07,
"logits/chosen": -1.071557641029358,
"logits/rejected": -1.10400390625,
"logps/chosen": -410.29998779296875,
"logps/rejected": -569.4000244140625,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.0126953125,
"rewards/margins": 18.615625381469727,
"rewards/rejected": -22.640625,
"step": 7260
},
{
"epoch": 3.1188713657332903,
"grad_norm": 0.012056094666844732,
"learning_rate": 2.2006437768240343e-07,
"logits/chosen": -1.0742676258087158,
"logits/rejected": -1.121923804283142,
"logps/chosen": -393.2749938964844,
"logps/rejected": -562.1500244140625,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.611523389816284,
"rewards/margins": 19.310937881469727,
"rewards/rejected": -22.917186737060547,
"step": 7270
},
{
"epoch": 3.1231627507778135,
"grad_norm": 0.010540804035967381,
"learning_rate": 2.1899141630901284e-07,
"logits/chosen": -1.112939476966858,
"logits/rejected": -1.143652319908142,
"logps/chosen": -413.7250061035156,
"logps/rejected": -578.9000244140625,
"loss": 0.0052,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.840966701507568,
"rewards/margins": 18.317188262939453,
"rewards/rejected": -23.162500381469727,
"step": 7280
},
{
"epoch": 3.1274541358223367,
"grad_norm": 0.003982637050952266,
"learning_rate": 2.179184549356223e-07,
"logits/chosen": -0.9849609136581421,
"logits/rejected": -1.0363280773162842,
"logps/chosen": -404.1875,
"logps/rejected": -567.2000122070312,
"loss": 0.0216,
"rewards/accuracies": 0.96875,
"rewards/chosen": -4.919921875,
"rewards/margins": 18.524999618530273,
"rewards/rejected": -23.434375762939453,
"step": 7290
},
{
"epoch": 3.13174552086686,
"grad_norm": 0.04562213197660063,
"learning_rate": 2.1684549356223175e-07,
"logits/chosen": -1.0841064453125,
"logits/rejected": -1.1157715320587158,
"logps/chosen": -414.82501220703125,
"logps/rejected": -572.7999877929688,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.109326124191284,
"rewards/margins": 18.7265625,
"rewards/rejected": -21.848438262939453,
"step": 7300
},
{
"epoch": 3.136036905911383,
"grad_norm": 0.004849745674894276,
"learning_rate": 2.157725321888412e-07,
"logits/chosen": -1.102197289466858,
"logits/rejected": -1.153173804283142,
"logps/chosen": -383.7250061035156,
"logps/rejected": -556.1500244140625,
"loss": 0.0003,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.674267530441284,
"rewards/margins": 19.375,
"rewards/rejected": -23.045312881469727,
"step": 7310
},
{
"epoch": 3.140328290955906,
"grad_norm": 0.0065743927772143025,
"learning_rate": 2.1469957081545062e-07,
"logits/chosen": -1.049658179283142,
"logits/rejected": -1.080322265625,
"logps/chosen": -398.98748779296875,
"logps/rejected": -563.8499755859375,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.922070503234863,
"rewards/margins": 19.034374237060547,
"rewards/rejected": -23.942188262939453,
"step": 7320
},
{
"epoch": 3.144619676000429,
"grad_norm": 0.0031089621853393,
"learning_rate": 2.1362660944206006e-07,
"logits/chosen": -1.13623046875,
"logits/rejected": -1.19580078125,
"logps/chosen": -415.3999938964844,
"logps/rejected": -586.5999755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.1915526390075684,
"rewards/margins": 19.740625381469727,
"rewards/rejected": -22.942188262939453,
"step": 7330
},
{
"epoch": 3.148911061044952,
"grad_norm": 0.30038112449218907,
"learning_rate": 2.1255364806866952e-07,
"logits/chosen": -1.0879395008087158,
"logits/rejected": -1.1259644031524658,
"logps/chosen": -417.1000061035156,
"logps/rejected": -538.4749755859375,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.221093654632568,
"rewards/margins": 17.765625,
"rewards/rejected": -21.985937118530273,
"step": 7340
},
{
"epoch": 3.1532024460894754,
"grad_norm": 0.05788266136678705,
"learning_rate": 2.1148068669527896e-07,
"logits/chosen": -1.0761229991912842,
"logits/rejected": -1.1498534679412842,
"logps/chosen": -431.3999938964844,
"logps/rejected": -586.9500122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.797558784484863,
"rewards/margins": 19.076562881469727,
"rewards/rejected": -23.864063262939453,
"step": 7350
},
{
"epoch": 3.1574938311339986,
"grad_norm": 8.441814448929113e-05,
"learning_rate": 2.1040772532188842e-07,
"logits/chosen": -1.105615258216858,
"logits/rejected": -1.178320288658142,
"logps/chosen": -446.17498779296875,
"logps/rejected": -558.1500244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.286523342132568,
"rewards/margins": 18.715625762939453,
"rewards/rejected": -22.995311737060547,
"step": 7360
},
{
"epoch": 3.161785216178522,
"grad_norm": 0.009512097378561528,
"learning_rate": 2.0933476394849783e-07,
"logits/chosen": -1.0654785633087158,
"logits/rejected": -1.091210961341858,
"logps/chosen": -413.79998779296875,
"logps/rejected": -584.9500122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.941504001617432,
"rewards/margins": 18.870311737060547,
"rewards/rejected": -23.803125381469727,
"step": 7370
},
{
"epoch": 3.1660766012230446,
"grad_norm": 0.012706208621092691,
"learning_rate": 2.0826180257510727e-07,
"logits/chosen": -1.134033203125,
"logits/rejected": -1.168701171875,
"logps/chosen": -371.8999938964844,
"logps/rejected": -546.7249755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.395215034484863,
"rewards/margins": 18.8359375,
"rewards/rejected": -23.223438262939453,
"step": 7380
},
{
"epoch": 3.1703679862675678,
"grad_norm": 0.002616459486340226,
"learning_rate": 2.0718884120171674e-07,
"logits/chosen": -1.1020019054412842,
"logits/rejected": -1.154150366783142,
"logps/chosen": -419.3500061035156,
"logps/rejected": -570.4000244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.803515434265137,
"rewards/margins": 18.598438262939453,
"rewards/rejected": -23.395313262939453,
"step": 7390
},
{
"epoch": 3.174659371312091,
"grad_norm": 0.0015572982583173006,
"learning_rate": 2.0611587982832617e-07,
"logits/chosen": -1.1628906726837158,
"logits/rejected": -1.1892578601837158,
"logps/chosen": -397.20001220703125,
"logps/rejected": -569.0750122070312,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.714745998382568,
"rewards/margins": 19.996875762939453,
"rewards/rejected": -24.709375381469727,
"step": 7400
},
{
"epoch": 3.178950756356614,
"grad_norm": 0.013222345952245489,
"learning_rate": 2.0504291845493564e-07,
"logits/chosen": -1.067285180091858,
"logits/rejected": -1.106689453125,
"logps/chosen": -409.04998779296875,
"logps/rejected": -583.8499755859375,
"loss": 0.0024,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.060351371765137,
"rewards/margins": 19.479686737060547,
"rewards/rejected": -24.553125381469727,
"step": 7410
},
{
"epoch": 3.1832421414011374,
"grad_norm": 0.1557683369587535,
"learning_rate": 2.0396995708154505e-07,
"logits/chosen": -1.09765625,
"logits/rejected": -1.124414086341858,
"logps/chosen": -416.70001220703125,
"logps/rejected": -608.0499877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.558154344558716,
"rewards/margins": 20.721874237060547,
"rewards/rejected": -24.28125,
"step": 7420
},
{
"epoch": 3.1875335264456606,
"grad_norm": 0.015822904250508526,
"learning_rate": 2.0289699570815449e-07,
"logits/chosen": -1.0731201171875,
"logits/rejected": -1.1497070789337158,
"logps/chosen": -421.9375,
"logps/rejected": -557.4500122070312,
"loss": 0.0048,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.479150295257568,
"rewards/margins": 19.7265625,
"rewards/rejected": -24.200000762939453,
"step": 7430
},
{
"epoch": 3.1918249114901833,
"grad_norm": 0.0007927777741120745,
"learning_rate": 2.0182403433476395e-07,
"logits/chosen": -1.1225097179412842,
"logits/rejected": -1.154882788658142,
"logps/chosen": -424.875,
"logps/rejected": -601.0,
"loss": 0.0107,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.0126953125,
"rewards/margins": 19.643749237060547,
"rewards/rejected": -24.654687881469727,
"step": 7440
},
{
"epoch": 3.1961162965347065,
"grad_norm": 3.878737566950894,
"learning_rate": 2.007510729613734e-07,
"logits/chosen": -1.180810570716858,
"logits/rejected": -1.2202637195587158,
"logps/chosen": -442.75,
"logps/rejected": -605.7000122070312,
"loss": 0.0131,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.404687404632568,
"rewards/margins": 19.315624237060547,
"rewards/rejected": -23.712499618530273,
"step": 7450
},
{
"epoch": 3.2004076815792297,
"grad_norm": 0.0059448786132387495,
"learning_rate": 1.996781115879828e-07,
"logits/chosen": -1.172753930091858,
"logits/rejected": -1.2078125476837158,
"logps/chosen": -412.2250061035156,
"logps/rejected": -580.5499877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.168530464172363,
"rewards/margins": 19.796875,
"rewards/rejected": -24.973438262939453,
"step": 7460
},
{
"epoch": 3.204699066623753,
"grad_norm": 0.026566817279985014,
"learning_rate": 1.9860515021459226e-07,
"logits/chosen": -1.0465819835662842,
"logits/rejected": -1.122460961341858,
"logps/chosen": -398.0249938964844,
"logps/rejected": -569.4000244140625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.805920362472534,
"rewards/margins": 18.8125,
"rewards/rejected": -22.615625381469727,
"step": 7470
},
{
"epoch": 3.208990451668276,
"grad_norm": 0.0570582178524798,
"learning_rate": 1.975321888412017e-07,
"logits/chosen": -1.108007788658142,
"logits/rejected": -1.130468726158142,
"logps/chosen": -403.5874938964844,
"logps/rejected": -521.5499877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.728283643722534,
"rewards/margins": 17.185937881469727,
"rewards/rejected": -20.90625,
"step": 7480
},
{
"epoch": 3.213281836712799,
"grad_norm": 0.10074334390774173,
"learning_rate": 1.9645922746781116e-07,
"logits/chosen": -1.1065247058868408,
"logits/rejected": -1.1827392578125,
"logps/chosen": -422.1499938964844,
"logps/rejected": -591.0999755859375,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.498730659484863,
"rewards/margins": 19.071874618530273,
"rewards/rejected": -23.564062118530273,
"step": 7490
},
{
"epoch": 3.217573221757322,
"grad_norm": 0.005671957823497198,
"learning_rate": 1.953862660944206e-07,
"logits/chosen": -1.144433617591858,
"logits/rejected": -1.178320288658142,
"logps/chosen": -423.57501220703125,
"logps/rejected": -575.0,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.390625,
"rewards/margins": 18.6796875,
"rewards/rejected": -24.060937881469727,
"step": 7500
},
{
"epoch": 3.2218646068018453,
"grad_norm": 0.009949736203342541,
"learning_rate": 1.9431330472103e-07,
"logits/chosen": -1.1103515625,
"logits/rejected": -1.1331055164337158,
"logps/chosen": -389.57501220703125,
"logps/rejected": -552.0499877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.111572265625,
"rewards/margins": 18.084375381469727,
"rewards/rejected": -22.185937881469727,
"step": 7510
},
{
"epoch": 3.2261559918463685,
"grad_norm": 0.01987592164099171,
"learning_rate": 1.9324034334763948e-07,
"logits/chosen": -1.0822021961212158,
"logits/rejected": -1.1204102039337158,
"logps/chosen": -419.875,
"logps/rejected": -578.2999877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.7591552734375,
"rewards/margins": 19.084375381469727,
"rewards/rejected": -23.837499618530273,
"step": 7520
},
{
"epoch": 3.2304473768908917,
"grad_norm": 0.00017210986266684387,
"learning_rate": 1.9216738197424891e-07,
"logits/chosen": -1.0680663585662842,
"logits/rejected": -1.1095702648162842,
"logps/chosen": -452.17498779296875,
"logps/rejected": -638.7000122070312,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.590478420257568,
"rewards/margins": 20.362499237060547,
"rewards/rejected": -24.942188262939453,
"step": 7530
},
{
"epoch": 3.2347387619354144,
"grad_norm": 0.0015576399921244165,
"learning_rate": 1.9109442060085838e-07,
"logits/chosen": -1.194921851158142,
"logits/rejected": -1.219824194908142,
"logps/chosen": -406.61248779296875,
"logps/rejected": -553.9000244140625,
"loss": 0.0047,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.10986328125,
"rewards/margins": 19.25,
"rewards/rejected": -24.370311737060547,
"step": 7540
},
{
"epoch": 3.2390301469799376,
"grad_norm": 0.0016778297394876907,
"learning_rate": 1.900214592274678e-07,
"logits/chosen": -0.9443359375,
"logits/rejected": -1.007104516029358,
"logps/chosen": -429.88751220703125,
"logps/rejected": -594.1500244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.302148342132568,
"rewards/margins": 19.889062881469727,
"rewards/rejected": -24.182811737060547,
"step": 7550
},
{
"epoch": 3.243321532024461,
"grad_norm": 0.011251358614406274,
"learning_rate": 1.8894849785407723e-07,
"logits/chosen": -0.925488293170929,
"logits/rejected": -0.976611316204071,
"logps/chosen": -360.54998779296875,
"logps/rejected": -566.5,
"loss": 0.0243,
"rewards/accuracies": 0.96875,
"rewards/chosen": -4.0889892578125,
"rewards/margins": 19.979686737060547,
"rewards/rejected": -24.060937881469727,
"step": 7560
},
{
"epoch": 3.247612917068984,
"grad_norm": 0.8187483739243558,
"learning_rate": 1.878755364806867e-07,
"logits/chosen": -1.0807616710662842,
"logits/rejected": -1.1400878429412842,
"logps/chosen": -416.4375,
"logps/rejected": -547.5999755859375,
"loss": 0.0131,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.018945217132568,
"rewards/margins": 18.854686737060547,
"rewards/rejected": -22.876562118530273,
"step": 7570
},
{
"epoch": 3.2519043021135072,
"grad_norm": 0.009726602724960827,
"learning_rate": 1.8680257510729613e-07,
"logits/chosen": -1.021997094154358,
"logits/rejected": -1.089990258216858,
"logps/chosen": -403.125,
"logps/rejected": -568.0999755859375,
"loss": 0.0014,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.712011814117432,
"rewards/margins": 18.395313262939453,
"rewards/rejected": -23.106250762939453,
"step": 7580
},
{
"epoch": 3.2561956871580304,
"grad_norm": 0.014207458339286431,
"learning_rate": 1.857296137339056e-07,
"logits/chosen": -1.108789086341858,
"logits/rejected": -1.1352050304412842,
"logps/chosen": -411.5249938964844,
"logps/rejected": -559.5499877929688,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.5798583030700684,
"rewards/margins": 19.768749237060547,
"rewards/rejected": -23.334375381469727,
"step": 7590
},
{
"epoch": 3.260487072202553,
"grad_norm": 0.006328679161499758,
"learning_rate": 1.84656652360515e-07,
"logits/chosen": -1.1180908679962158,
"logits/rejected": -1.165136694908142,
"logps/chosen": -446.42498779296875,
"logps/rejected": -599.8499755859375,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.420214653015137,
"rewards/margins": 18.715625762939453,
"rewards/rejected": -23.134374618530273,
"step": 7600
},
{
"epoch": 3.2647784572470764,
"grad_norm": 0.03741625752538844,
"learning_rate": 1.8358369098712444e-07,
"logits/chosen": -1.1806640625,
"logits/rejected": -1.2287108898162842,
"logps/chosen": -409.4750061035156,
"logps/rejected": -563.5,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.049829006195068,
"rewards/margins": 19.295312881469727,
"rewards/rejected": -23.348438262939453,
"step": 7610
},
{
"epoch": 3.2690698422915996,
"grad_norm": 6.541874933149319,
"learning_rate": 1.825107296137339e-07,
"logits/chosen": -1.063818335533142,
"logits/rejected": -1.106054663658142,
"logps/chosen": -437.5,
"logps/rejected": -580.0,
"loss": 0.0056,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.458349704742432,
"rewards/margins": 17.975000381469727,
"rewards/rejected": -22.432811737060547,
"step": 7620
},
{
"epoch": 3.273361227336123,
"grad_norm": 0.006254891814542349,
"learning_rate": 1.8143776824034334e-07,
"logits/chosen": -1.151953101158142,
"logits/rejected": -1.208251953125,
"logps/chosen": -421.6000061035156,
"logps/rejected": -543.7999877929688,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.941992282867432,
"rewards/margins": 18.354686737060547,
"rewards/rejected": -23.287500381469727,
"step": 7630
},
{
"epoch": 3.277652612380646,
"grad_norm": 0.032208732610917536,
"learning_rate": 1.8036480686695278e-07,
"logits/chosen": -1.007836937904358,
"logits/rejected": -1.048681616783142,
"logps/chosen": -381.625,
"logps/rejected": -563.5250244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.9909911155700684,
"rewards/margins": 19.082813262939453,
"rewards/rejected": -23.084375381469727,
"step": 7640
},
{
"epoch": 3.281943997425169,
"grad_norm": 0.003997162204992917,
"learning_rate": 1.7929184549356222e-07,
"logits/chosen": -1.1282470226287842,
"logits/rejected": -1.153710961341858,
"logps/chosen": -383.3125,
"logps/rejected": -555.9000244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.053027153015137,
"rewards/margins": 18.149999618530273,
"rewards/rejected": -22.196874618530273,
"step": 7650
},
{
"epoch": 3.286235382469692,
"grad_norm": 0.0016323746838290136,
"learning_rate": 1.7821888412017165e-07,
"logits/chosen": -1.15185546875,
"logits/rejected": -1.191796898841858,
"logps/chosen": -415.0249938964844,
"logps/rejected": -565.0999755859375,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.0958251953125,
"rewards/margins": 19.348438262939453,
"rewards/rejected": -23.439062118530273,
"step": 7660
},
{
"epoch": 3.290526767514215,
"grad_norm": 15.325049227365643,
"learning_rate": 1.7714592274678112e-07,
"logits/chosen": -1.088964819908142,
"logits/rejected": -1.140527367591858,
"logps/chosen": -391.3500061035156,
"logps/rejected": -536.0999755859375,
"loss": 0.0136,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.533056735992432,
"rewards/margins": 18.339061737060547,
"rewards/rejected": -22.864063262939453,
"step": 7670
},
{
"epoch": 3.2948181525587383,
"grad_norm": 2.616642428342158,
"learning_rate": 1.7607296137339055e-07,
"logits/chosen": -1.1190917491912842,
"logits/rejected": -1.156494140625,
"logps/chosen": -436.45001220703125,
"logps/rejected": -606.6500244140625,
"loss": 0.0132,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.8875732421875,
"rewards/margins": 19.284374237060547,
"rewards/rejected": -23.174999237060547,
"step": 7680
},
{
"epoch": 3.2991095376032615,
"grad_norm": 0.014484864568080628,
"learning_rate": 1.75e-07,
"logits/chosen": -1.0398681163787842,
"logits/rejected": -1.076904296875,
"logps/chosen": -429.3374938964844,
"logps/rejected": -590.1500244140625,
"loss": 0.0051,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.8251953125,
"rewards/margins": 17.607812881469727,
"rewards/rejected": -23.428125381469727,
"step": 7690
},
{
"epoch": 3.3034009226477847,
"grad_norm": 0.008089391321756274,
"learning_rate": 1.7392703862660943e-07,
"logits/chosen": -1.09716796875,
"logits/rejected": -1.154394507408142,
"logps/chosen": -394.5,
"logps/rejected": -598.4000244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.268945217132568,
"rewards/margins": 20.6015625,
"rewards/rejected": -25.856250762939453,
"step": 7700
},
{
"epoch": 3.3076923076923075,
"grad_norm": 0.0075349949953169,
"learning_rate": 1.7285407725321887e-07,
"logits/chosen": -1.15869140625,
"logits/rejected": -1.2034180164337158,
"logps/chosen": -418.4750061035156,
"logps/rejected": -576.9000244140625,
"loss": 0.0049,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.557421684265137,
"rewards/margins": 18.826562881469727,
"rewards/rejected": -24.390625,
"step": 7710
},
{
"epoch": 3.3119836927368307,
"grad_norm": 0.03239436523639938,
"learning_rate": 1.7178111587982833e-07,
"logits/chosen": -1.123437523841858,
"logits/rejected": -1.1945312023162842,
"logps/chosen": -388.54998779296875,
"logps/rejected": -546.0999755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.828125,
"rewards/margins": 18.75,
"rewards/rejected": -23.595312118530273,
"step": 7720
},
{
"epoch": 3.316275077781354,
"grad_norm": 0.012913075946874353,
"learning_rate": 1.7070815450643777e-07,
"logits/chosen": -1.129150390625,
"logits/rejected": -1.186621069908142,
"logps/chosen": -409.375,
"logps/rejected": -576.0499877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.027783393859863,
"rewards/margins": 19.018749237060547,
"rewards/rejected": -24.049999237060547,
"step": 7730
},
{
"epoch": 3.320566462825877,
"grad_norm": 0.3081401482911639,
"learning_rate": 1.696351931330472e-07,
"logits/chosen": -1.031457543373108,
"logits/rejected": -1.0567505359649658,
"logps/chosen": -432.29998779296875,
"logps/rejected": -571.7000122070312,
"loss": 0.0131,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.695898532867432,
"rewards/margins": 19.145313262939453,
"rewards/rejected": -23.831249237060547,
"step": 7740
},
{
"epoch": 3.3248578478704003,
"grad_norm": 0.06500816883734759,
"learning_rate": 1.6856223175965664e-07,
"logits/chosen": -1.1437499523162842,
"logits/rejected": -1.174218773841858,
"logps/chosen": -421.92498779296875,
"logps/rejected": -589.1500244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.138085842132568,
"rewards/margins": 18.364063262939453,
"rewards/rejected": -23.503124237060547,
"step": 7750
},
{
"epoch": 3.3291492329149235,
"grad_norm": 0.010808352624494583,
"learning_rate": 1.6748927038626608e-07,
"logits/chosen": -1.135009765625,
"logits/rejected": -1.1886107921600342,
"logps/chosen": -453.75,
"logps/rejected": -600.1500244140625,
"loss": 0.0006,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.870019435882568,
"rewards/margins": 18.845312118530273,
"rewards/rejected": -23.728124618530273,
"step": 7760
},
{
"epoch": 3.3334406179594462,
"grad_norm": 0.054381280214576826,
"learning_rate": 1.6641630901287554e-07,
"logits/chosen": -1.214746117591858,
"logits/rejected": -1.224511742591858,
"logps/chosen": -443.5249938964844,
"logps/rejected": -586.5499877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.556542873382568,
"rewards/margins": 18.353124618530273,
"rewards/rejected": -23.924999237060547,
"step": 7770
},
{
"epoch": 3.3377320030039694,
"grad_norm": 0.13625770026161219,
"learning_rate": 1.6534334763948496e-07,
"logits/chosen": -1.093237280845642,
"logits/rejected": -1.158935546875,
"logps/chosen": -430.67498779296875,
"logps/rejected": -594.6749877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.848876953125,
"rewards/margins": 20.254688262939453,
"rewards/rejected": -25.100000381469727,
"step": 7780
},
{
"epoch": 3.3420233880484926,
"grad_norm": 0.026210135428165512,
"learning_rate": 1.6427038626609442e-07,
"logits/chosen": -1.149023413658142,
"logits/rejected": -1.197851538658142,
"logps/chosen": -437.23748779296875,
"logps/rejected": -610.0999755859375,
"loss": 0.0084,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.936718940734863,
"rewards/margins": 19.004688262939453,
"rewards/rejected": -23.943750381469727,
"step": 7790
},
{
"epoch": 3.346314773093016,
"grad_norm": 0.009880691659967484,
"learning_rate": 1.6319742489270386e-07,
"logits/chosen": -1.033203125,
"logits/rejected": -1.090966820716858,
"logps/chosen": -414.9125061035156,
"logps/rejected": -589.3499755859375,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.807104587554932,
"rewards/margins": 19.185937881469727,
"rewards/rejected": -24.009374618530273,
"step": 7800
},
{
"epoch": 3.350606158137539,
"grad_norm": 0.019381656753884636,
"learning_rate": 1.621244635193133e-07,
"logits/chosen": -1.123022437095642,
"logits/rejected": -1.153924584388733,
"logps/chosen": -402.6000061035156,
"logps/rejected": -547.7000122070312,
"loss": 0.026,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -5.301855564117432,
"rewards/margins": 18.357812881469727,
"rewards/rejected": -23.659374237060547,
"step": 7810
},
{
"epoch": 3.3548975431820622,
"grad_norm": 19.218437911000994,
"learning_rate": 1.6105150214592276e-07,
"logits/chosen": -1.194921851158142,
"logits/rejected": -1.1987793445587158,
"logps/chosen": -384.5,
"logps/rejected": -568.8499755859375,
"loss": 0.0048,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.235449314117432,
"rewards/margins": 18.671875,
"rewards/rejected": -23.90625,
"step": 7820
},
{
"epoch": 3.359188928226585,
"grad_norm": 0.03159748574516458,
"learning_rate": 1.5997854077253217e-07,
"logits/chosen": -1.0241210460662842,
"logits/rejected": -1.0974609851837158,
"logps/chosen": -426.9750061035156,
"logps/rejected": -602.0,
"loss": 0.0141,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.150830268859863,
"rewards/margins": 19.799999237060547,
"rewards/rejected": -24.940624237060547,
"step": 7830
},
{
"epoch": 3.363480313271108,
"grad_norm": 0.008474964749175029,
"learning_rate": 1.5890557939914163e-07,
"logits/chosen": -1.1995117664337158,
"logits/rejected": -1.245214819908142,
"logps/chosen": -419.7250061035156,
"logps/rejected": -633.1500244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.628204345703125,
"rewards/margins": 20.345312118530273,
"rewards/rejected": -24.975000381469727,
"step": 7840
},
{
"epoch": 3.3677716983156314,
"grad_norm": 0.1128953239722341,
"learning_rate": 1.5783261802575107e-07,
"logits/chosen": -1.0924804210662842,
"logits/rejected": -1.138574242591858,
"logps/chosen": -379.7250061035156,
"logps/rejected": -577.8499755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.306542873382568,
"rewards/margins": 19.215625762939453,
"rewards/rejected": -24.524999618530273,
"step": 7850
},
{
"epoch": 3.3720630833601546,
"grad_norm": 0.010289820953143607,
"learning_rate": 1.567596566523605e-07,
"logits/chosen": -1.1528809070587158,
"logits/rejected": -1.223242163658142,
"logps/chosen": -408.29998779296875,
"logps/rejected": -566.9000244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.283154487609863,
"rewards/margins": 19.600000381469727,
"rewards/rejected": -24.889062881469727,
"step": 7860
},
{
"epoch": 3.376354468404678,
"grad_norm": 0.028458235935922418,
"learning_rate": 1.5568669527896995e-07,
"logits/chosen": -1.1438477039337158,
"logits/rejected": -1.193945288658142,
"logps/chosen": -415.42498779296875,
"logps/rejected": -568.2000122070312,
"loss": 0.0181,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.93316650390625,
"rewards/margins": 19.53125,
"rewards/rejected": -24.453125,
"step": 7870
},
{
"epoch": 3.3806458534492005,
"grad_norm": 0.03620517556992207,
"learning_rate": 1.5461373390557938e-07,
"logits/chosen": -1.1495361328125,
"logits/rejected": -1.1992676258087158,
"logps/chosen": -446.9750061035156,
"logps/rejected": -568.3499755859375,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.263952732086182,
"rewards/margins": 18.0703125,
"rewards/rejected": -23.339061737060547,
"step": 7880
},
{
"epoch": 3.3849372384937237,
"grad_norm": 0.006374012863317528,
"learning_rate": 1.5354077253218882e-07,
"logits/chosen": -1.0954711437225342,
"logits/rejected": -1.147705078125,
"logps/chosen": -412.7250061035156,
"logps/rejected": -591.7999877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.102929592132568,
"rewards/margins": 20.232812881469727,
"rewards/rejected": -25.340625762939453,
"step": 7890
},
{
"epoch": 3.389228623538247,
"grad_norm": 0.01200608581709591,
"learning_rate": 1.5246781115879828e-07,
"logits/chosen": -1.158593773841858,
"logits/rejected": -1.17626953125,
"logps/chosen": -404.9750061035156,
"logps/rejected": -591.2000122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.934814453125,
"rewards/margins": 20.407812118530273,
"rewards/rejected": -25.337499618530273,
"step": 7900
},
{
"epoch": 3.39352000858277,
"grad_norm": 0.003774743701495429,
"learning_rate": 1.5139484978540772e-07,
"logits/chosen": -1.17041015625,
"logits/rejected": -1.1916015148162842,
"logps/chosen": -429.1000061035156,
"logps/rejected": -584.7000122070312,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.457421779632568,
"rewards/margins": 19.032812118530273,
"rewards/rejected": -24.481250762939453,
"step": 7910
},
{
"epoch": 3.3978113936272933,
"grad_norm": 0.01691640942005166,
"learning_rate": 1.5032188841201716e-07,
"logits/chosen": -1.115966796875,
"logits/rejected": -1.16015625,
"logps/chosen": -407.2250061035156,
"logps/rejected": -586.9000244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.930468559265137,
"rewards/margins": 20.854686737060547,
"rewards/rejected": -25.784374237060547,
"step": 7920
},
{
"epoch": 3.402102778671816,
"grad_norm": 0.0006230714969723587,
"learning_rate": 1.492489270386266e-07,
"logits/chosen": -1.102783203125,
"logits/rejected": -1.1399657726287842,
"logps/chosen": -416.1000061035156,
"logps/rejected": -595.5999755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.092761039733887,
"rewards/margins": 20.723438262939453,
"rewards/rejected": -24.799999237060547,
"step": 7930
},
{
"epoch": 3.4063941637163393,
"grad_norm": 0.34343849654144964,
"learning_rate": 1.4817596566523603e-07,
"logits/chosen": -1.085107445716858,
"logits/rejected": -1.1638672351837158,
"logps/chosen": -441.29998779296875,
"logps/rejected": -627.6500244140625,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.952160835266113,
"rewards/margins": 21.689062118530273,
"rewards/rejected": -26.6328125,
"step": 7940
},
{
"epoch": 3.4106855487608625,
"grad_norm": 0.01324665773238559,
"learning_rate": 1.471030042918455e-07,
"logits/chosen": -1.107421875,
"logits/rejected": -1.1540038585662842,
"logps/chosen": -393.67498779296875,
"logps/rejected": -558.7000122070312,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.610058784484863,
"rewards/margins": 19.417186737060547,
"rewards/rejected": -24.015625,
"step": 7950
},
{
"epoch": 3.4149769338053857,
"grad_norm": 0.0030413582330390187,
"learning_rate": 1.460300429184549e-07,
"logits/chosen": -1.148290991783142,
"logits/rejected": -1.20556640625,
"logps/chosen": -412.07501220703125,
"logps/rejected": -580.5499877929688,
"loss": 0.0086,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.329687595367432,
"rewards/margins": 20.0234375,
"rewards/rejected": -24.356250762939453,
"step": 7960
},
{
"epoch": 3.419268318849909,
"grad_norm": 0.07526660026754835,
"learning_rate": 1.4495708154506437e-07,
"logits/chosen": -1.134057641029358,
"logits/rejected": -1.143310546875,
"logps/chosen": -423.2250061035156,
"logps/rejected": -587.3499755859375,
"loss": 0.0131,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.134228706359863,
"rewards/margins": 19.142187118530273,
"rewards/rejected": -24.270313262939453,
"step": 7970
},
{
"epoch": 3.423559703894432,
"grad_norm": 0.0010662944733789812,
"learning_rate": 1.438841201716738e-07,
"logits/chosen": -1.068212866783142,
"logits/rejected": -1.1121094226837158,
"logps/chosen": -397.1000061035156,
"logps/rejected": -593.3499755859375,
"loss": 0.0298,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.976513862609863,
"rewards/margins": 20.193750381469727,
"rewards/rejected": -25.184375762939453,
"step": 7980
},
{
"epoch": 3.4278510889389553,
"grad_norm": 0.012003322880143812,
"learning_rate": 1.4281115879828325e-07,
"logits/chosen": -1.142480492591858,
"logits/rejected": -1.201171875,
"logps/chosen": -426.75,
"logps/rejected": -592.7000122070312,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.889746189117432,
"rewards/margins": 20.056249618530273,
"rewards/rejected": -24.951562881469727,
"step": 7990
},
{
"epoch": 3.432142473983478,
"grad_norm": 82.2444202819973,
"learning_rate": 1.417381974248927e-07,
"logits/chosen": -1.158105492591858,
"logits/rejected": -1.186621069908142,
"logps/chosen": -403.1000061035156,
"logps/rejected": -577.1500244140625,
"loss": 0.0178,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.324609279632568,
"rewards/margins": 20.339061737060547,
"rewards/rejected": -25.649999618530273,
"step": 8000
},
{
"epoch": 3.4364338590280012,
"grad_norm": 0.030842181041924824,
"learning_rate": 1.4066523605150212e-07,
"logits/chosen": -1.1731445789337158,
"logits/rejected": -1.223388671875,
"logps/chosen": -434.2749938964844,
"logps/rejected": -620.8499755859375,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.7216796875,
"rewards/margins": 20.114063262939453,
"rewards/rejected": -24.834375381469727,
"step": 8010
},
{
"epoch": 3.4407252440725244,
"grad_norm": 0.001207826784579018,
"learning_rate": 1.395922746781116e-07,
"logits/chosen": -1.15625,
"logits/rejected": -1.19287109375,
"logps/chosen": -441.7749938964844,
"logps/rejected": -597.25,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.583788871765137,
"rewards/margins": 18.717187881469727,
"rewards/rejected": -24.301563262939453,
"step": 8020
},
{
"epoch": 3.4450166291170476,
"grad_norm": 0.0019996286224288145,
"learning_rate": 1.3851931330472102e-07,
"logits/chosen": -1.1330077648162842,
"logits/rejected": -1.163964867591858,
"logps/chosen": -382.3999938964844,
"logps/rejected": -603.5,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.21051025390625,
"rewards/margins": 19.8046875,
"rewards/rejected": -25.009374618530273,
"step": 8030
},
{
"epoch": 3.449308014161571,
"grad_norm": 1.4631629423211996,
"learning_rate": 1.3744635193133046e-07,
"logits/chosen": -1.207128882408142,
"logits/rejected": -1.254492163658142,
"logps/chosen": -437.9624938964844,
"logps/rejected": -642.5,
"loss": 0.0048,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.7852783203125,
"rewards/margins": 20.143749237060547,
"rewards/rejected": -24.954687118530273,
"step": 8040
},
{
"epoch": 3.4535993992060936,
"grad_norm": 0.013598695279643053,
"learning_rate": 1.3637339055793993e-07,
"logits/chosen": -1.19677734375,
"logits/rejected": -1.249414086341858,
"logps/chosen": -420.70001220703125,
"logps/rejected": -577.2000122070312,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.064160346984863,
"rewards/margins": 19.543750762939453,
"rewards/rejected": -23.603124618530273,
"step": 8050
},
{
"epoch": 3.457890784250617,
"grad_norm": 0.02450884297939579,
"learning_rate": 1.3530042918454934e-07,
"logits/chosen": -1.124548316001892,
"logits/rejected": -1.1672852039337158,
"logps/chosen": -417.625,
"logps/rejected": -574.1500244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.458691596984863,
"rewards/margins": 19.470312118530273,
"rewards/rejected": -23.931249618530273,
"step": 8060
},
{
"epoch": 3.46218216929514,
"grad_norm": 0.0032686712163600604,
"learning_rate": 1.342274678111588e-07,
"logits/chosen": -1.049658179283142,
"logits/rejected": -1.137939453125,
"logps/chosen": -390.20001220703125,
"logps/rejected": -571.9000244140625,
"loss": 0.0175,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.260351657867432,
"rewards/margins": 19.470312118530273,
"rewards/rejected": -24.723438262939453,
"step": 8070
},
{
"epoch": 3.466473554339663,
"grad_norm": 0.015332844797687078,
"learning_rate": 1.3315450643776824e-07,
"logits/chosen": -1.1382324695587158,
"logits/rejected": -1.178955078125,
"logps/chosen": -381.2250061035156,
"logps/rejected": -591.0499877929688,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.236132621765137,
"rewards/margins": 20.931249618530273,
"rewards/rejected": -26.159374237060547,
"step": 8080
},
{
"epoch": 3.4707649393841864,
"grad_norm": 0.7092839372780634,
"learning_rate": 1.3208154506437768e-07,
"logits/chosen": -1.175073266029358,
"logits/rejected": -1.2043945789337158,
"logps/chosen": -399.98748779296875,
"logps/rejected": -568.7999877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.623486518859863,
"rewards/margins": 19.123437881469727,
"rewards/rejected": -24.753124237060547,
"step": 8090
},
{
"epoch": 3.475056324428709,
"grad_norm": 0.006423304329476774,
"learning_rate": 1.310085836909871e-07,
"logits/chosen": -1.1774413585662842,
"logits/rejected": -1.2195312976837158,
"logps/chosen": -423.3999938964844,
"logps/rejected": -630.4500122070312,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.335741996765137,
"rewards/margins": 20.939062118530273,
"rewards/rejected": -25.264062881469727,
"step": 8100
},
{
"epoch": 3.4793477094732324,
"grad_norm": 0.007657271842911379,
"learning_rate": 1.2993562231759655e-07,
"logits/chosen": -1.140771508216858,
"logits/rejected": -1.171044945716858,
"logps/chosen": -436.5,
"logps/rejected": -606.1500244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.464306831359863,
"rewards/margins": 19.760936737060547,
"rewards/rejected": -24.228124618530273,
"step": 8110
},
{
"epoch": 3.4836390945177556,
"grad_norm": 0.008409242658158721,
"learning_rate": 1.2886266094420601e-07,
"logits/chosen": -1.159570336341858,
"logits/rejected": -1.2205078601837158,
"logps/chosen": -424.45001220703125,
"logps/rejected": -583.6500244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.229467868804932,
"rewards/margins": 19.120311737060547,
"rewards/rejected": -24.350000381469727,
"step": 8120
},
{
"epoch": 3.4879304795622788,
"grad_norm": 0.03381226688135793,
"learning_rate": 1.2778969957081545e-07,
"logits/chosen": -1.171875,
"logits/rejected": -1.204199194908142,
"logps/chosen": -395.1000061035156,
"logps/rejected": -569.0999755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.168774604797363,
"rewards/margins": 19.012500762939453,
"rewards/rejected": -23.182811737060547,
"step": 8130
},
{
"epoch": 3.492221864606802,
"grad_norm": 0.08610832246223908,
"learning_rate": 1.267167381974249e-07,
"logits/chosen": -1.195214867591858,
"logits/rejected": -1.246679663658142,
"logps/chosen": -428.07501220703125,
"logps/rejected": -584.9000244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.810595512390137,
"rewards/margins": 18.720312118530273,
"rewards/rejected": -23.524999618530273,
"step": 8140
},
{
"epoch": 3.496513249651325,
"grad_norm": 0.010742797782946869,
"learning_rate": 1.2564377682403433e-07,
"logits/chosen": -1.132714867591858,
"logits/rejected": -1.18798828125,
"logps/chosen": -445.125,
"logps/rejected": -640.75,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.706835746765137,
"rewards/margins": 21.009374618530273,
"rewards/rejected": -25.721874237060547,
"step": 8150
},
{
"epoch": 3.5008046346958483,
"grad_norm": 0.0057678395562779546,
"learning_rate": 1.2457081545064376e-07,
"logits/chosen": -1.196997046470642,
"logits/rejected": -1.2295410633087158,
"logps/chosen": -454.07501220703125,
"logps/rejected": -605.5,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.809887886047363,
"rewards/margins": 20.048437118530273,
"rewards/rejected": -24.862499237060547,
"step": 8160
},
{
"epoch": 3.505096019740371,
"grad_norm": 0.015205031767764289,
"learning_rate": 1.2349785407725323e-07,
"logits/chosen": -1.1923828125,
"logits/rejected": -1.2169921398162842,
"logps/chosen": -385.5249938964844,
"logps/rejected": -577.25,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.830883979797363,
"rewards/margins": 19.621875762939453,
"rewards/rejected": -24.454687118530273,
"step": 8170
},
{
"epoch": 3.5093874047848943,
"grad_norm": 0.005920411784687027,
"learning_rate": 1.2242489270386264e-07,
"logits/chosen": -1.035009741783142,
"logits/rejected": -1.063562035560608,
"logps/chosen": -399.25,
"logps/rejected": -602.9000244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.027441501617432,
"rewards/margins": 20.659374237060547,
"rewards/rejected": -25.681249618530273,
"step": 8180
},
{
"epoch": 3.5136787898294175,
"grad_norm": 0.02422476760611223,
"learning_rate": 1.213519313304721e-07,
"logits/chosen": -1.177832007408142,
"logits/rejected": -1.165429711341858,
"logps/chosen": -418.32501220703125,
"logps/rejected": -613.0999755859375,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.979101657867432,
"rewards/margins": 20.059375762939453,
"rewards/rejected": -26.046875,
"step": 8190
},
{
"epoch": 3.5179701748739407,
"grad_norm": 0.0035385363225243207,
"learning_rate": 1.2027896995708154e-07,
"logits/chosen": -1.1566040515899658,
"logits/rejected": -1.198144555091858,
"logps/chosen": -441.82501220703125,
"logps/rejected": -585.1500244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.383935451507568,
"rewards/margins": 19.307811737060547,
"rewards/rejected": -24.696874618530273,
"step": 8200
},
{
"epoch": 3.522261559918464,
"grad_norm": 0.015340100058724833,
"learning_rate": 1.1920600858369098e-07,
"logits/chosen": -1.1886718273162842,
"logits/rejected": -1.2389647960662842,
"logps/chosen": -432.54998779296875,
"logps/rejected": -567.1500244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.60498046875,
"rewards/margins": 19.3984375,
"rewards/rejected": -25.0078125,
"step": 8210
},
{
"epoch": 3.5265529449629867,
"grad_norm": 0.0046605012507767735,
"learning_rate": 1.1813304721030043e-07,
"logits/chosen": -1.330078125,
"logits/rejected": -1.330468773841858,
"logps/chosen": -458.8999938964844,
"logps/rejected": -621.5,
"loss": 0.0005,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.110888481140137,
"rewards/margins": 19.424999237060547,
"rewards/rejected": -24.53125,
"step": 8220
},
{
"epoch": 3.53084433000751,
"grad_norm": 0.05525991035519728,
"learning_rate": 1.1706008583690987e-07,
"logits/chosen": -1.1921875476837158,
"logits/rejected": -1.2214844226837158,
"logps/chosen": -421.4750061035156,
"logps/rejected": -572.1500244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.306542873382568,
"rewards/margins": 19.339061737060547,
"rewards/rejected": -24.65625,
"step": 8230
},
{
"epoch": 3.535135715052033,
"grad_norm": 0.007116013633970248,
"learning_rate": 1.1598712446351932e-07,
"logits/chosen": -1.2008788585662842,
"logits/rejected": -1.27734375,
"logps/chosen": -426.125,
"logps/rejected": -556.5,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.968554496765137,
"rewards/margins": 19.420312881469727,
"rewards/rejected": -24.392187118530273,
"step": 8240
},
{
"epoch": 3.5394271000965563,
"grad_norm": 0.3805637531011174,
"learning_rate": 1.1491416309012874e-07,
"logits/chosen": -1.2132079601287842,
"logits/rejected": -1.25390625,
"logps/chosen": -417.0,
"logps/rejected": -588.25,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.109375,
"rewards/margins": 19.826562881469727,
"rewards/rejected": -24.934375762939453,
"step": 8250
},
{
"epoch": 3.5437184851410795,
"grad_norm": 0.029586090663247917,
"learning_rate": 1.1384120171673819e-07,
"logits/chosen": -1.114111304283142,
"logits/rejected": -1.1476562023162842,
"logps/chosen": -391.1499938964844,
"logps/rejected": -568.6500244140625,
"loss": 0.009,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.879443168640137,
"rewards/margins": 19.456249237060547,
"rewards/rejected": -24.3359375,
"step": 8260
},
{
"epoch": 3.548009870185602,
"grad_norm": 150.64189207084723,
"learning_rate": 1.1276824034334763e-07,
"logits/chosen": -1.1459472179412842,
"logits/rejected": -1.168212890625,
"logps/chosen": -414.7749938964844,
"logps/rejected": -588.5,
"loss": 0.0126,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.650586128234863,
"rewards/margins": 20.784374237060547,
"rewards/rejected": -25.424999237060547,
"step": 8270
},
{
"epoch": 3.5523012552301254,
"grad_norm": 8.545537961573473,
"learning_rate": 1.1169527896995708e-07,
"logits/chosen": -1.1368896961212158,
"logits/rejected": -1.181640625,
"logps/chosen": -362.375,
"logps/rejected": -557.7999877929688,
"loss": 0.0054,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.553124904632568,
"rewards/margins": 19.496875762939453,
"rewards/rejected": -24.0546875,
"step": 8280
},
{
"epoch": 3.5565926402746486,
"grad_norm": 0.03396961142928566,
"learning_rate": 1.1062231759656653e-07,
"logits/chosen": -1.143798828125,
"logits/rejected": -1.1921265125274658,
"logps/chosen": -410.125,
"logps/rejected": -590.0499877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.22509765625,
"rewards/margins": 19.774999618530273,
"rewards/rejected": -25.012500762939453,
"step": 8290
},
{
"epoch": 3.560884025319172,
"grad_norm": 0.03836962606758187,
"learning_rate": 1.0954935622317595e-07,
"logits/chosen": -1.1392333507537842,
"logits/rejected": -1.1644287109375,
"logps/chosen": -409.75,
"logps/rejected": -575.5,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.59912109375,
"rewards/margins": 19.339061737060547,
"rewards/rejected": -24.950000762939453,
"step": 8300
},
{
"epoch": 3.565175410363695,
"grad_norm": 0.1319076339282744,
"learning_rate": 1.084763948497854e-07,
"logits/chosen": -1.100488305091858,
"logits/rejected": -1.1226074695587158,
"logps/chosen": -398.7250061035156,
"logps/rejected": -591.5,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.386523246765137,
"rewards/margins": 19.967967987060547,
"rewards/rejected": -25.342187881469727,
"step": 8310
},
{
"epoch": 3.5694667954082178,
"grad_norm": 0.013255963897236104,
"learning_rate": 1.0740343347639484e-07,
"logits/chosen": -1.27001953125,
"logits/rejected": -1.300390601158142,
"logps/chosen": -441.79998779296875,
"logps/rejected": -585.2000122070312,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.059618949890137,
"rewards/margins": 20.268749237060547,
"rewards/rejected": -25.326562881469727,
"step": 8320
},
{
"epoch": 3.573758180452741,
"grad_norm": 0.017935620569501418,
"learning_rate": 1.0633047210300429e-07,
"logits/chosen": -1.1029052734375,
"logits/rejected": -1.1689453125,
"logps/chosen": -394.20001220703125,
"logps/rejected": -607.5999755859375,
"loss": 0.0074,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.909960746765137,
"rewards/margins": 20.596874237060547,
"rewards/rejected": -25.503124237060547,
"step": 8330
},
{
"epoch": 3.578049565497264,
"grad_norm": 0.010512842233830077,
"learning_rate": 1.0525751072961373e-07,
"logits/chosen": -1.196679711341858,
"logits/rejected": -1.2370116710662842,
"logps/chosen": -474.42498779296875,
"logps/rejected": -621.1500244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.546093940734863,
"rewards/margins": 19.149999618530273,
"rewards/rejected": -24.700000762939453,
"step": 8340
},
{
"epoch": 3.5823409505417874,
"grad_norm": 1.1612297571321948,
"learning_rate": 1.0418454935622317e-07,
"logits/chosen": -1.201171875,
"logits/rejected": -1.254785180091858,
"logps/chosen": -449.5,
"logps/rejected": -580.7000122070312,
"loss": 0.0133,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.069091796875,
"rewards/margins": 18.453125,
"rewards/rejected": -23.526561737060547,
"step": 8350
},
{
"epoch": 3.5866323355863106,
"grad_norm": 0.6031746746918992,
"learning_rate": 1.031115879828326e-07,
"logits/chosen": -1.0625,
"logits/rejected": -1.134130835533142,
"logps/chosen": -399.625,
"logps/rejected": -579.2999877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.983544826507568,
"rewards/margins": 19.201562881469727,
"rewards/rejected": -24.189062118530273,
"step": 8360
},
{
"epoch": 3.5909237206308338,
"grad_norm": 0.034385041454836895,
"learning_rate": 1.0203862660944206e-07,
"logits/chosen": -1.203027367591858,
"logits/rejected": -1.19384765625,
"logps/chosen": -429.875,
"logps/rejected": -607.2999877929688,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.474609375,
"rewards/margins": 19.285938262939453,
"rewards/rejected": -24.753124237060547,
"step": 8370
},
{
"epoch": 3.595215105675357,
"grad_norm": 0.006919599887907935,
"learning_rate": 1.0096566523605151e-07,
"logits/chosen": -1.13134765625,
"logits/rejected": -1.174560546875,
"logps/chosen": -407.29998779296875,
"logps/rejected": -548.125,
"loss": 0.0243,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.267187595367432,
"rewards/margins": 18.051563262939453,
"rewards/rejected": -23.314062118530273,
"step": 8380
},
{
"epoch": 3.5995064907198797,
"grad_norm": 0.426549414736646,
"learning_rate": 9.989270386266093e-08,
"logits/chosen": -1.186669945716858,
"logits/rejected": -1.2199218273162842,
"logps/chosen": -385.375,
"logps/rejected": -589.4000244140625,
"loss": 0.0088,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.575488090515137,
"rewards/margins": 20.6171875,
"rewards/rejected": -25.196874618530273,
"step": 8390
},
{
"epoch": 3.603797875764403,
"grad_norm": 0.014428582321994409,
"learning_rate": 9.881974248927038e-08,
"logits/chosen": -1.153564453125,
"logits/rejected": -1.216699242591858,
"logps/chosen": -425.67498779296875,
"logps/rejected": -595.1500244140625,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.942578315734863,
"rewards/margins": 18.684375762939453,
"rewards/rejected": -23.623437881469727,
"step": 8400
},
{
"epoch": 3.608089260808926,
"grad_norm": 0.007049499544214462,
"learning_rate": 9.774678111587982e-08,
"logits/chosen": -1.1842041015625,
"logits/rejected": -1.2451171875,
"logps/chosen": -437.95001220703125,
"logps/rejected": -596.4500122070312,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.171093940734863,
"rewards/margins": 19.451562881469727,
"rewards/rejected": -24.625,
"step": 8410
},
{
"epoch": 3.6123806458534493,
"grad_norm": 0.023125194554903444,
"learning_rate": 9.667381974248927e-08,
"logits/chosen": -1.2317383289337158,
"logits/rejected": -1.305029273033142,
"logps/chosen": -401.7250061035156,
"logps/rejected": -572.9500122070312,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.224707126617432,
"rewards/margins": 19.629688262939453,
"rewards/rejected": -24.860937118530273,
"step": 8420
},
{
"epoch": 3.6166720308979725,
"grad_norm": 0.0010436821012540236,
"learning_rate": 9.560085836909871e-08,
"logits/chosen": -1.1028320789337158,
"logits/rejected": -1.158300757408142,
"logps/chosen": -378.20001220703125,
"logps/rejected": -565.4000244140625,
"loss": 0.0188,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.609570503234863,
"rewards/margins": 20.212499618530273,
"rewards/rejected": -24.814062118530273,
"step": 8430
},
{
"epoch": 3.6209634159424953,
"grad_norm": 0.02702237318003246,
"learning_rate": 9.452789699570815e-08,
"logits/chosen": -1.1737792491912842,
"logits/rejected": -1.2073242664337158,
"logps/chosen": -430.3500061035156,
"logps/rejected": -611.25,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.385644435882568,
"rewards/margins": 19.059375762939453,
"rewards/rejected": -24.435937881469727,
"step": 8440
},
{
"epoch": 3.6252548009870185,
"grad_norm": 0.052244393047937335,
"learning_rate": 9.34549356223176e-08,
"logits/chosen": -1.1113770008087158,
"logits/rejected": -1.147680640220642,
"logps/chosen": -408.92498779296875,
"logps/rejected": -577.1500244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.613085746765137,
"rewards/margins": 20.084375381469727,
"rewards/rejected": -24.690624237060547,
"step": 8450
},
{
"epoch": 3.6295461860315417,
"grad_norm": 0.01939988567590373,
"learning_rate": 9.238197424892703e-08,
"logits/chosen": -1.1155273914337158,
"logits/rejected": -1.158056616783142,
"logps/chosen": -398.5,
"logps/rejected": -593.8499755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.90771484375,
"rewards/margins": 18.248437881469727,
"rewards/rejected": -23.167186737060547,
"step": 8460
},
{
"epoch": 3.633837571076065,
"grad_norm": 0.11734794410730569,
"learning_rate": 9.130901287553648e-08,
"logits/chosen": -1.0884277820587158,
"logits/rejected": -1.158544898033142,
"logps/chosen": -376.9125061035156,
"logps/rejected": -567.9500122070312,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.1920166015625,
"rewards/margins": 19.7734375,
"rewards/rejected": -24.971874237060547,
"step": 8470
},
{
"epoch": 3.638128956120588,
"grad_norm": 63.50828196672935,
"learning_rate": 9.023605150214592e-08,
"logits/chosen": -1.1023437976837158,
"logits/rejected": -1.1388671398162842,
"logps/chosen": -423.4750061035156,
"logps/rejected": -574.5,
"loss": 0.0417,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.053515434265137,
"rewards/margins": 19.235937118530273,
"rewards/rejected": -24.299999237060547,
"step": 8480
},
{
"epoch": 3.642420341165111,
"grad_norm": 0.5946343830684734,
"learning_rate": 8.916309012875536e-08,
"logits/chosen": -1.1142089366912842,
"logits/rejected": -1.1716797351837158,
"logps/chosen": -426.1499938964844,
"logps/rejected": -591.9000244140625,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.137402534484863,
"rewards/margins": 19.606250762939453,
"rewards/rejected": -24.732812881469727,
"step": 8490
},
{
"epoch": 3.646711726209634,
"grad_norm": 11.20458934232315,
"learning_rate": 8.80901287553648e-08,
"logits/chosen": -1.1569335460662842,
"logits/rejected": -1.1858642101287842,
"logps/chosen": -430.82501220703125,
"logps/rejected": -553.2999877929688,
"loss": 0.0024,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.823876857757568,
"rewards/margins": 18.964061737060547,
"rewards/rejected": -23.771875381469727,
"step": 8500
},
{
"epoch": 3.651003111254157,
"grad_norm": 0.016355504391497244,
"learning_rate": 8.701716738197425e-08,
"logits/chosen": -1.1650879383087158,
"logits/rejected": -1.203466773033142,
"logps/chosen": -430.79998779296875,
"logps/rejected": -581.75,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.818799018859863,
"rewards/margins": 19.073436737060547,
"rewards/rejected": -23.887500762939453,
"step": 8510
},
{
"epoch": 3.6552944962986804,
"grad_norm": 0.011776871793671703,
"learning_rate": 8.594420600858368e-08,
"logits/chosen": -1.256738305091858,
"logits/rejected": -1.2671387195587158,
"logps/chosen": -394.6000061035156,
"logps/rejected": -591.25,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.537060737609863,
"rewards/margins": 19.8671875,
"rewards/rejected": -25.415624618530273,
"step": 8520
},
{
"epoch": 3.6595858813432036,
"grad_norm": 0.047168494203315085,
"learning_rate": 8.487124463519314e-08,
"logits/chosen": -1.1472656726837158,
"logits/rejected": -1.207983374595642,
"logps/chosen": -428.5,
"logps/rejected": -604.0,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.100488185882568,
"rewards/margins": 20.3125,
"rewards/rejected": -25.407812118530273,
"step": 8530
},
{
"epoch": 3.6638772663877264,
"grad_norm": 0.008613503592405865,
"learning_rate": 8.379828326180257e-08,
"logits/chosen": -1.1666991710662842,
"logits/rejected": -1.2208983898162842,
"logps/chosen": -403.54998779296875,
"logps/rejected": -592.7999877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.676465034484863,
"rewards/margins": 20.146875381469727,
"rewards/rejected": -25.837499618530273,
"step": 8540
},
{
"epoch": 3.66816865143225,
"grad_norm": 0.7005315117328474,
"learning_rate": 8.272532188841201e-08,
"logits/chosen": -1.1213867664337158,
"logits/rejected": -1.1579101085662842,
"logps/chosen": -422.57501220703125,
"logps/rejected": -569.5,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.765429496765137,
"rewards/margins": 19.556249618530273,
"rewards/rejected": -25.325000762939453,
"step": 8550
},
{
"epoch": 3.6724600364767728,
"grad_norm": 0.009648771564342145,
"learning_rate": 8.165236051502146e-08,
"logits/chosen": -1.0265991687774658,
"logits/rejected": -1.0940673351287842,
"logps/chosen": -419.04998779296875,
"logps/rejected": -574.5999755859375,
"loss": 0.0177,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.427783012390137,
"rewards/margins": 18.901561737060547,
"rewards/rejected": -24.318750381469727,
"step": 8560
},
{
"epoch": 3.676751421521296,
"grad_norm": 0.009627641295976356,
"learning_rate": 8.05793991416309e-08,
"logits/chosen": -1.0927002429962158,
"logits/rejected": -1.1087524890899658,
"logps/chosen": -387.875,
"logps/rejected": -571.0250244140625,
"loss": 0.0176,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.486718654632568,
"rewards/margins": 19.465625762939453,
"rewards/rejected": -24.956249237060547,
"step": 8570
},
{
"epoch": 3.681042806565819,
"grad_norm": 0.02063193695921579,
"learning_rate": 7.950643776824034e-08,
"logits/chosen": -1.140649437904358,
"logits/rejected": -1.1853516101837158,
"logps/chosen": -426.1000061035156,
"logps/rejected": -594.8499755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.322265625,
"rewards/margins": 19.876562118530273,
"rewards/rejected": -25.1875,
"step": 8580
},
{
"epoch": 3.6853341916103424,
"grad_norm": 0.008542792450343666,
"learning_rate": 7.843347639484977e-08,
"logits/chosen": -1.1705443859100342,
"logits/rejected": -1.227148413658142,
"logps/chosen": -430.8500061035156,
"logps/rejected": -624.3499755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.431054592132568,
"rewards/margins": 19.567188262939453,
"rewards/rejected": -24.987499237060547,
"step": 8590
},
{
"epoch": 3.6896255766548656,
"grad_norm": 0.03321597572821151,
"learning_rate": 7.736051502145922e-08,
"logits/chosen": -1.0995361804962158,
"logits/rejected": -1.1615478992462158,
"logps/chosen": -407.625,
"logps/rejected": -612.0999755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.202050685882568,
"rewards/margins": 20.03125,
"rewards/rejected": -26.237499237060547,
"step": 8600
},
{
"epoch": 3.6939169616993883,
"grad_norm": 0.7687063951855772,
"learning_rate": 7.628755364806867e-08,
"logits/chosen": -1.105932593345642,
"logits/rejected": -1.1331787109375,
"logps/chosen": -403.8125,
"logps/rejected": -590.6124877929688,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.930078029632568,
"rewards/margins": 19.387500762939453,
"rewards/rejected": -24.321874618530273,
"step": 8610
},
{
"epoch": 3.6982083467439115,
"grad_norm": 0.013251509903096039,
"learning_rate": 7.521459227467811e-08,
"logits/chosen": -1.134667992591858,
"logits/rejected": -1.1613280773162842,
"logps/chosen": -373.82501220703125,
"logps/rejected": -526.8499755859375,
"loss": 0.0389,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -5.658789157867432,
"rewards/margins": 18.024999618530273,
"rewards/rejected": -23.681249618530273,
"step": 8620
},
{
"epoch": 3.7024997317884347,
"grad_norm": 0.009906141003661512,
"learning_rate": 7.414163090128755e-08,
"logits/chosen": -1.14990234375,
"logits/rejected": -1.189843773841858,
"logps/chosen": -413.3999938964844,
"logps/rejected": -600.0499877929688,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.3974609375,
"rewards/margins": 20.021875381469727,
"rewards/rejected": -26.421875,
"step": 8630
},
{
"epoch": 3.706791116832958,
"grad_norm": 2.345995632282609,
"learning_rate": 7.306866952789699e-08,
"logits/chosen": -1.185546875,
"logits/rejected": -1.227441430091858,
"logps/chosen": -413.1499938964844,
"logps/rejected": -609.8499755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.889452934265137,
"rewards/margins": 20.482812881469727,
"rewards/rejected": -26.365625381469727,
"step": 8640
},
{
"epoch": 3.711082501877481,
"grad_norm": 0.05875854584665483,
"learning_rate": 7.199570815450644e-08,
"logits/chosen": -1.144628882408142,
"logits/rejected": -1.1782715320587158,
"logps/chosen": -426.79998779296875,
"logps/rejected": -587.25,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.925000190734863,
"rewards/margins": 19.9140625,
"rewards/rejected": -25.840625762939453,
"step": 8650
},
{
"epoch": 3.715373886922004,
"grad_norm": 0.0009066449772924871,
"learning_rate": 7.092274678111587e-08,
"logits/chosen": -1.1748046875,
"logits/rejected": -1.2217285633087158,
"logps/chosen": -434.70001220703125,
"logps/rejected": -581.0499877929688,
"loss": 0.0088,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.889843940734863,
"rewards/margins": 19.135936737060547,
"rewards/rejected": -24.028125762939453,
"step": 8660
},
{
"epoch": 3.719665271966527,
"grad_norm": 0.018555419012686265,
"learning_rate": 6.984978540772533e-08,
"logits/chosen": -1.1774413585662842,
"logits/rejected": -1.1995117664337158,
"logps/chosen": -414.1000061035156,
"logps/rejected": -586.5499877929688,
"loss": 0.0056,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.23974609375,
"rewards/margins": 19.862499237060547,
"rewards/rejected": -25.104686737060547,
"step": 8670
},
{
"epoch": 3.7239566570110503,
"grad_norm": 0.07186117976952897,
"learning_rate": 6.877682403433475e-08,
"logits/chosen": -1.076025366783142,
"logits/rejected": -1.126611351966858,
"logps/chosen": -417.5,
"logps/rejected": -574.7000122070312,
"loss": 0.0049,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.630566596984863,
"rewards/margins": 20.09375,
"rewards/rejected": -25.71875,
"step": 8680
},
{
"epoch": 3.7282480420555735,
"grad_norm": 0.3500929697138476,
"learning_rate": 6.77038626609442e-08,
"logits/chosen": -1.169531226158142,
"logits/rejected": -1.218359351158142,
"logps/chosen": -430.42498779296875,
"logps/rejected": -622.4500122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.948290824890137,
"rewards/margins": 20.340625762939453,
"rewards/rejected": -26.306249618530273,
"step": 8690
},
{
"epoch": 3.7325394271000967,
"grad_norm": 0.04287049011548471,
"learning_rate": 6.663090128755365e-08,
"logits/chosen": -1.178808569908142,
"logits/rejected": -1.217871069908142,
"logps/chosen": -413.5375061035156,
"logps/rejected": -552.3499755859375,
"loss": 0.0098,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.390527248382568,
"rewards/margins": 19.048437118530273,
"rewards/rejected": -24.451562881469727,
"step": 8700
},
{
"epoch": 3.7368308121446194,
"grad_norm": 0.7638228099649663,
"learning_rate": 6.555793991416309e-08,
"logits/chosen": -1.1450684070587158,
"logits/rejected": -1.1697266101837158,
"logps/chosen": -440.8500061035156,
"logps/rejected": -608.3499755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.300195217132568,
"rewards/margins": 20.012500762939453,
"rewards/rejected": -25.318750381469727,
"step": 8710
},
{
"epoch": 3.741122197189143,
"grad_norm": 0.05362729115251585,
"learning_rate": 6.448497854077254e-08,
"logits/chosen": -1.2199218273162842,
"logits/rejected": -1.2786133289337158,
"logps/chosen": -424.7749938964844,
"logps/rejected": -570.4249877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.472265720367432,
"rewards/margins": 18.778125762939453,
"rewards/rejected": -24.248437881469727,
"step": 8720
},
{
"epoch": 3.745413582233666,
"grad_norm": 0.0015457125940328896,
"learning_rate": 6.341201716738196e-08,
"logits/chosen": -1.105859398841858,
"logits/rejected": -1.1628906726837158,
"logps/chosen": -440.0249938964844,
"logps/rejected": -604.9000244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.180371284484863,
"rewards/margins": 20.107812881469727,
"rewards/rejected": -25.296875,
"step": 8730
},
{
"epoch": 3.749704967278189,
"grad_norm": 0.00897334687468335,
"learning_rate": 6.233905579399141e-08,
"logits/chosen": -1.1243896484375,
"logits/rejected": -1.203271508216858,
"logps/chosen": -404.0,
"logps/rejected": -584.3499755859375,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.476171970367432,
"rewards/margins": 18.776561737060547,
"rewards/rejected": -25.256250381469727,
"step": 8740
},
{
"epoch": 3.7539963523227122,
"grad_norm": 0.8382933068986903,
"learning_rate": 6.126609442060085e-08,
"logits/chosen": -1.149169921875,
"logits/rejected": -1.165283203125,
"logps/chosen": -408.1875,
"logps/rejected": -603.4500122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.2392578125,
"rewards/margins": 20.681249618530273,
"rewards/rejected": -25.921875,
"step": 8750
},
{
"epoch": 3.7582877373672354,
"grad_norm": 0.019262215984209605,
"learning_rate": 6.01931330472103e-08,
"logits/chosen": -1.12060546875,
"logits/rejected": -1.1537353992462158,
"logps/chosen": -411.61248779296875,
"logps/rejected": -578.25,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.814013481140137,
"rewards/margins": 19.459375381469727,
"rewards/rejected": -24.253124237060547,
"step": 8760
},
{
"epoch": 3.7625791224117586,
"grad_norm": 0.003031795927683085,
"learning_rate": 5.912017167381974e-08,
"logits/chosen": -1.1413085460662842,
"logits/rejected": -1.15234375,
"logps/chosen": -414.0249938964844,
"logps/rejected": -589.9000244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.6142578125,
"rewards/margins": 19.428125381469727,
"rewards/rejected": -25.042186737060547,
"step": 8770
},
{
"epoch": 3.7668705074562814,
"grad_norm": 0.004916795604384672,
"learning_rate": 5.8047210300429184e-08,
"logits/chosen": -1.1911132335662842,
"logits/rejected": -1.215917944908142,
"logps/chosen": -438.0249938964844,
"logps/rejected": -594.0,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.287841796875,
"rewards/margins": 19.8984375,
"rewards/rejected": -25.212499618530273,
"step": 8780
},
{
"epoch": 3.7711618925008046,
"grad_norm": 0.2725158571382876,
"learning_rate": 5.697424892703862e-08,
"logits/chosen": -1.133886694908142,
"logits/rejected": -1.1789062023162842,
"logps/chosen": -446.2250061035156,
"logps/rejected": -621.5,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.412695407867432,
"rewards/margins": 20.174999237060547,
"rewards/rejected": -25.590625762939453,
"step": 8790
},
{
"epoch": 3.775453277545328,
"grad_norm": 0.0003881513738795367,
"learning_rate": 5.5901287553648065e-08,
"logits/chosen": -1.129003882408142,
"logits/rejected": -1.1956055164337158,
"logps/chosen": -433.82501220703125,
"logps/rejected": -624.4000244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.087450981140137,
"rewards/margins": 19.653125762939453,
"rewards/rejected": -24.745311737060547,
"step": 8800
},
{
"epoch": 3.779744662589851,
"grad_norm": 0.016658203031237096,
"learning_rate": 5.482832618025751e-08,
"logits/chosen": -1.269433617591858,
"logits/rejected": -1.296972632408142,
"logps/chosen": -416.7250061035156,
"logps/rejected": -603.25,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.615283012390137,
"rewards/margins": 20.009374618530273,
"rewards/rejected": -24.635936737060547,
"step": 8810
},
{
"epoch": 3.784036047634374,
"grad_norm": 0.11604748123006396,
"learning_rate": 5.3755364806866953e-08,
"logits/chosen": -1.096435546875,
"logits/rejected": -1.1467773914337158,
"logps/chosen": -365.92498779296875,
"logps/rejected": -561.9000244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.550488471984863,
"rewards/margins": 19.528125762939453,
"rewards/rejected": -25.0703125,
"step": 8820
},
{
"epoch": 3.788327432678897,
"grad_norm": 0.001816564124599535,
"learning_rate": 5.268240343347639e-08,
"logits/chosen": -1.1362793445587158,
"logits/rejected": -1.186132788658142,
"logps/chosen": -390.875,
"logps/rejected": -574.2999877929688,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.0009765625,
"rewards/margins": 19.954687118530273,
"rewards/rejected": -24.962499618530273,
"step": 8830
},
{
"epoch": 3.79261881772342,
"grad_norm": 0.009763879262715845,
"learning_rate": 5.1609442060085835e-08,
"logits/chosen": -1.130029320716858,
"logits/rejected": -1.1472656726837158,
"logps/chosen": -416.57501220703125,
"logps/rejected": -603.2000122070312,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.990234375,
"rewards/margins": 18.829687118530273,
"rewards/rejected": -24.815624237060547,
"step": 8840
},
{
"epoch": 3.7969102027679433,
"grad_norm": 0.034224130519936925,
"learning_rate": 5.053648068669528e-08,
"logits/chosen": -1.200659155845642,
"logits/rejected": -1.220312476158142,
"logps/chosen": -416.29998779296875,
"logps/rejected": -588.9500122070312,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.940087795257568,
"rewards/margins": 19.4140625,
"rewards/rejected": -24.340625762939453,
"step": 8850
},
{
"epoch": 3.8012015878124665,
"grad_norm": 0.004546701605052007,
"learning_rate": 4.9463519313304716e-08,
"logits/chosen": -1.0882568359375,
"logits/rejected": -1.15478515625,
"logps/chosen": -398.73748779296875,
"logps/rejected": -563.2999877929688,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.063867092132568,
"rewards/margins": 19.649999618530273,
"rewards/rejected": -24.703125,
"step": 8860
},
{
"epoch": 3.8054929728569897,
"grad_norm": 0.0036128855282883234,
"learning_rate": 4.839055793991416e-08,
"logits/chosen": -1.1306641101837158,
"logits/rejected": -1.1904296875,
"logps/chosen": -398.1499938964844,
"logps/rejected": -548.5,
"loss": 0.014,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.91455078125,
"rewards/margins": 19.639062881469727,
"rewards/rejected": -24.553125381469727,
"step": 8870
},
{
"epoch": 3.8097843579015125,
"grad_norm": 0.3817359344560652,
"learning_rate": 4.73175965665236e-08,
"logits/chosen": -1.0784423351287842,
"logits/rejected": -1.135498046875,
"logps/chosen": -421.7250061035156,
"logps/rejected": -567.2000122070312,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.0078125,
"rewards/margins": 19.745311737060547,
"rewards/rejected": -24.762500762939453,
"step": 8880
},
{
"epoch": 3.8140757429460357,
"grad_norm": 0.006240846256120957,
"learning_rate": 4.624463519313305e-08,
"logits/chosen": -1.186914086341858,
"logits/rejected": -1.21044921875,
"logps/chosen": -409.375,
"logps/rejected": -592.7000122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.807470798492432,
"rewards/margins": 19.232812881469727,
"rewards/rejected": -25.059375762939453,
"step": 8890
},
{
"epoch": 3.818367127990559,
"grad_norm": 0.007952048563600921,
"learning_rate": 4.517167381974249e-08,
"logits/chosen": -1.1313965320587158,
"logits/rejected": -1.179589867591858,
"logps/chosen": -421.8500061035156,
"logps/rejected": -565.8499755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.587695121765137,
"rewards/margins": 18.723438262939453,
"rewards/rejected": -24.303125381469727,
"step": 8900
},
{
"epoch": 3.822658513035082,
"grad_norm": 0.01724901381153147,
"learning_rate": 4.409871244635193e-08,
"logits/chosen": -1.06494140625,
"logits/rejected": -1.092626929283142,
"logps/chosen": -414.125,
"logps/rejected": -609.3499755859375,
"loss": 0.0174,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.836181640625,
"rewards/margins": 20.185937881469727,
"rewards/rejected": -26.0078125,
"step": 8910
},
{
"epoch": 3.8269498980796053,
"grad_norm": 0.008326764096645971,
"learning_rate": 4.3025751072961374e-08,
"logits/chosen": -1.177734375,
"logits/rejected": -1.1969726085662842,
"logps/chosen": -388.3500061035156,
"logps/rejected": -570.0999755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.16650390625,
"rewards/margins": 19.923437118530273,
"rewards/rejected": -24.079687118530273,
"step": 8920
},
{
"epoch": 3.831241283124128,
"grad_norm": 0.33242534611412916,
"learning_rate": 4.195278969957081e-08,
"logits/chosen": -1.22900390625,
"logits/rejected": -1.289648413658142,
"logps/chosen": -411.20001220703125,
"logps/rejected": -577.8499755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.445068359375,
"rewards/margins": 19.932811737060547,
"rewards/rejected": -26.368749618530273,
"step": 8930
},
{
"epoch": 3.8355326681686517,
"grad_norm": 0.006276648363819293,
"learning_rate": 4.0879828326180256e-08,
"logits/chosen": -1.109375,
"logits/rejected": -1.175878882408142,
"logps/chosen": -416.6499938964844,
"logps/rejected": -578.6500244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.922656059265137,
"rewards/margins": 19.681249618530273,
"rewards/rejected": -25.612499237060547,
"step": 8940
},
{
"epoch": 3.8398240532131744,
"grad_norm": 0.013605303107122827,
"learning_rate": 3.980686695278969e-08,
"logits/chosen": -1.2322266101837158,
"logits/rejected": -1.2883789539337158,
"logps/chosen": -406.75,
"logps/rejected": -600.2999877929688,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.696215629577637,
"rewards/margins": 19.8515625,
"rewards/rejected": -25.565624237060547,
"step": 8950
},
{
"epoch": 3.8441154382576976,
"grad_norm": 0.009679535285228419,
"learning_rate": 3.873390557939914e-08,
"logits/chosen": -1.1540405750274658,
"logits/rejected": -1.1765625476837158,
"logps/chosen": -404.875,
"logps/rejected": -574.75,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.732251167297363,
"rewards/margins": 20.024999618530273,
"rewards/rejected": -24.762500762939453,
"step": 8960
},
{
"epoch": 3.848406823302221,
"grad_norm": 0.003163681431655965,
"learning_rate": 3.766094420600859e-08,
"logits/chosen": -1.166406273841858,
"logits/rejected": -1.20166015625,
"logps/chosen": -406.9750061035156,
"logps/rejected": -614.75,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.773535251617432,
"rewards/margins": 21.017187118530273,
"rewards/rejected": -25.787500381469727,
"step": 8970
},
{
"epoch": 3.852698208346744,
"grad_norm": 0.24376124547916087,
"learning_rate": 3.6587982832618025e-08,
"logits/chosen": -1.1422851085662842,
"logits/rejected": -1.1750977039337158,
"logps/chosen": -422.67498779296875,
"logps/rejected": -582.9500122070312,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.2293701171875,
"rewards/margins": 19.390625,
"rewards/rejected": -24.618749618530273,
"step": 8980
},
{
"epoch": 3.8569895933912672,
"grad_norm": 0.18061318769593468,
"learning_rate": 3.551502145922747e-08,
"logits/chosen": -1.19287109375,
"logits/rejected": -1.2336914539337158,
"logps/chosen": -421.875,
"logps/rejected": -567.9500122070312,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.7822265625,
"rewards/margins": 19.9453125,
"rewards/rejected": -24.725000381469727,
"step": 8990
},
{
"epoch": 3.86128097843579,
"grad_norm": 7.442839648940899,
"learning_rate": 3.444206008583691e-08,
"logits/chosen": -1.174658179283142,
"logits/rejected": -1.2516601085662842,
"logps/chosen": -433.29998779296875,
"logps/rejected": -603.4000244140625,
"loss": 0.006,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.202343940734863,
"rewards/margins": 19.2578125,
"rewards/rejected": -25.450000762939453,
"step": 9000
},
{
"epoch": 3.865572363480313,
"grad_norm": 0.0038657539091527873,
"learning_rate": 3.336909871244635e-08,
"logits/chosen": -1.1528809070587158,
"logits/rejected": -1.1877930164337158,
"logps/chosen": -418.3500061035156,
"logps/rejected": -598.7000122070312,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.153857231140137,
"rewards/margins": 20.620311737060547,
"rewards/rejected": -25.787500381469727,
"step": 9010
},
{
"epoch": 3.8698637485248364,
"grad_norm": 0.01779707500865911,
"learning_rate": 3.229613733905579e-08,
"logits/chosen": -1.1757323741912842,
"logits/rejected": -1.226171851158142,
"logps/chosen": -412.1000061035156,
"logps/rejected": -600.75,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.138916015625,
"rewards/margins": 20.018749237060547,
"rewards/rejected": -25.162500381469727,
"step": 9020
},
{
"epoch": 3.8741551335693596,
"grad_norm": 0.00692639799944452,
"learning_rate": 3.122317596566524e-08,
"logits/chosen": -1.174414038658142,
"logits/rejected": -1.226171851158142,
"logps/chosen": -412.75,
"logps/rejected": -568.5999755859375,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.194726467132568,
"rewards/margins": 19.270313262939453,
"rewards/rejected": -25.475000381469727,
"step": 9030
},
{
"epoch": 3.878446518613883,
"grad_norm": 0.13162765013878067,
"learning_rate": 3.0150214592274677e-08,
"logits/chosen": -1.137182593345642,
"logits/rejected": -1.1811034679412842,
"logps/chosen": -395.7749938964844,
"logps/rejected": -565.5499877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.177380561828613,
"rewards/margins": 20.206249237060547,
"rewards/rejected": -25.387500762939453,
"step": 9040
},
{
"epoch": 3.8827379036584055,
"grad_norm": 1.5255453705841067,
"learning_rate": 2.9077253218884117e-08,
"logits/chosen": -1.1381347179412842,
"logits/rejected": -1.1803710460662842,
"logps/chosen": -406.23748779296875,
"logps/rejected": -585.0750122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.33056640625,
"rewards/margins": 19.440624237060547,
"rewards/rejected": -24.756250381469727,
"step": 9050
},
{
"epoch": 3.8870292887029287,
"grad_norm": 0.006947421828447531,
"learning_rate": 2.800429184549356e-08,
"logits/chosen": -1.19189453125,
"logits/rejected": -1.2062499523162842,
"logps/chosen": -422.8999938964844,
"logps/rejected": -578.5,
"loss": 0.0106,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.400341987609863,
"rewards/margins": 18.881250381469727,
"rewards/rejected": -24.28125,
"step": 9060
},
{
"epoch": 3.891320673747452,
"grad_norm": 0.16422902027485328,
"learning_rate": 2.6931330472103006e-08,
"logits/chosen": -1.1759765148162842,
"logits/rejected": -1.220678687095642,
"logps/chosen": -408.82501220703125,
"logps/rejected": -594.0499877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.097021579742432,
"rewards/margins": 20.837499618530273,
"rewards/rejected": -25.924999237060547,
"step": 9070
},
{
"epoch": 3.895612058791975,
"grad_norm": 0.0018380816437804641,
"learning_rate": 2.5858369098712446e-08,
"logits/chosen": -1.1725585460662842,
"logits/rejected": -1.2155272960662842,
"logps/chosen": -436.6000061035156,
"logps/rejected": -597.8499755859375,
"loss": 0.0045,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.912011623382568,
"rewards/margins": 19.528125762939453,
"rewards/rejected": -25.434375762939453,
"step": 9080
},
{
"epoch": 3.8999034438364983,
"grad_norm": 0.18461594911843315,
"learning_rate": 2.4785407725321887e-08,
"logits/chosen": -1.102294921875,
"logits/rejected": -1.150976538658142,
"logps/chosen": -397.6499938964844,
"logps/rejected": -586.5999755859375,
"loss": 0.0191,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.325097560882568,
"rewards/margins": 18.228124618530273,
"rewards/rejected": -24.556249618530273,
"step": 9090
},
{
"epoch": 3.904194828881021,
"grad_norm": 0.010766425612135111,
"learning_rate": 2.3712446351931328e-08,
"logits/chosen": -1.1015136241912842,
"logits/rejected": -1.1376953125,
"logps/chosen": -424.70001220703125,
"logps/rejected": -594.9500122070312,
"loss": 0.001,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.347729682922363,
"rewards/margins": 20.268749237060547,
"rewards/rejected": -25.612499237060547,
"step": 9100
},
{
"epoch": 3.9084862139255447,
"grad_norm": 0.0038996436424056013,
"learning_rate": 2.2639484978540772e-08,
"logits/chosen": -1.143652319908142,
"logits/rejected": -1.1872069835662842,
"logps/chosen": -444.1499938964844,
"logps/rejected": -628.25,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -6.237011909484863,
"rewards/margins": 20.728124618530273,
"rewards/rejected": -26.962499618530273,
"step": 9110
},
{
"epoch": 3.9127775989700675,
"grad_norm": 0.5447118938993043,
"learning_rate": 2.1566523605150216e-08,
"logits/chosen": -1.068750023841858,
"logits/rejected": -1.108642578125,
"logps/chosen": -394.36248779296875,
"logps/rejected": -565.0250244140625,
"loss": 0.026,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -4.714257717132568,
"rewards/margins": 18.384374618530273,
"rewards/rejected": -23.100000381469727,
"step": 9120
},
{
"epoch": 3.9170689840145907,
"grad_norm": 0.0057429841399033515,
"learning_rate": 2.0493562231759657e-08,
"logits/chosen": -1.143457055091858,
"logits/rejected": -1.150976538658142,
"logps/chosen": -421.1000061035156,
"logps/rejected": -595.0,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.350878715515137,
"rewards/margins": 18.831249237060547,
"rewards/rejected": -24.190624237060547,
"step": 9130
},
{
"epoch": 3.921360369059114,
"grad_norm": 0.0017402942739525417,
"learning_rate": 1.9420600858369097e-08,
"logits/chosen": -1.19970703125,
"logits/rejected": -1.252539038658142,
"logps/chosen": -429.04998779296875,
"logps/rejected": -625.0499877929688,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -6.002539157867432,
"rewards/margins": 20.151561737060547,
"rewards/rejected": -26.153125762939453,
"step": 9140
},
{
"epoch": 3.925651754103637,
"grad_norm": 0.00236581055839428,
"learning_rate": 1.834763948497854e-08,
"logits/chosen": -1.138085961341858,
"logits/rejected": -1.1799805164337158,
"logps/chosen": -401.79998779296875,
"logps/rejected": -605.5999755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.485497951507568,
"rewards/margins": 20.420312881469727,
"rewards/rejected": -25.915624618530273,
"step": 9150
},
{
"epoch": 3.9299431391481603,
"grad_norm": 6.580424826946325,
"learning_rate": 1.7274678111587982e-08,
"logits/chosen": -1.1097900867462158,
"logits/rejected": -1.149999976158142,
"logps/chosen": -383.375,
"logps/rejected": -568.0499877929688,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.230664253234863,
"rewards/margins": 19.6640625,
"rewards/rejected": -24.895313262939453,
"step": 9160
},
{
"epoch": 3.934234524192683,
"grad_norm": 1.8991061018483988,
"learning_rate": 1.6201716738197423e-08,
"logits/chosen": -1.115026831626892,
"logits/rejected": -1.196874976158142,
"logps/chosen": -403.57501220703125,
"logps/rejected": -599.8499755859375,
"loss": 0.0747,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.606640815734863,
"rewards/margins": 19.954687118530273,
"rewards/rejected": -25.551563262939453,
"step": 9170
},
{
"epoch": 3.9385259092372062,
"grad_norm": 0.09548242071216996,
"learning_rate": 1.5128755364806867e-08,
"logits/chosen": -1.131445288658142,
"logits/rejected": -1.160546898841858,
"logps/chosen": -399.7250061035156,
"logps/rejected": -576.5,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.366747856140137,
"rewards/margins": 19.971874237060547,
"rewards/rejected": -25.340625762939453,
"step": 9180
},
{
"epoch": 3.9428172942817294,
"grad_norm": 0.10064597849730939,
"learning_rate": 1.4055793991416308e-08,
"logits/chosen": -1.2252929210662842,
"logits/rejected": -1.27001953125,
"logps/chosen": -433.7749938964844,
"logps/rejected": -619.7000122070312,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.671582221984863,
"rewards/margins": 19.793750762939453,
"rewards/rejected": -25.434375762939453,
"step": 9190
},
{
"epoch": 3.9471086793262526,
"grad_norm": 0.5725614041457924,
"learning_rate": 1.2982832618025752e-08,
"logits/chosen": -1.1168944835662842,
"logits/rejected": -1.1872069835662842,
"logps/chosen": -434.7250061035156,
"logps/rejected": -609.25,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.802099704742432,
"rewards/margins": 20.440624237060547,
"rewards/rejected": -26.240625381469727,
"step": 9200
},
{
"epoch": 3.951400064370776,
"grad_norm": 0.010639907743597816,
"learning_rate": 1.1909871244635193e-08,
"logits/chosen": -1.1735351085662842,
"logits/rejected": -1.197119116783142,
"logps/chosen": -376.70001220703125,
"logps/rejected": -564.0499877929688,
"loss": 0.0001,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.043798923492432,
"rewards/margins": 20.931249618530273,
"rewards/rejected": -24.978124618530273,
"step": 9210
},
{
"epoch": 3.9556914494152986,
"grad_norm": 0.00221853467668428,
"learning_rate": 1.0836909871244635e-08,
"logits/chosen": -1.120849609375,
"logits/rejected": -1.188134789466858,
"logps/chosen": -408.42498779296875,
"logps/rejected": -593.9000244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.590112209320068,
"rewards/margins": 19.431249618530273,
"rewards/rejected": -25.032812118530273,
"step": 9220
},
{
"epoch": 3.959982834459822,
"grad_norm": 0.026782085902069052,
"learning_rate": 9.763948497854078e-09,
"logits/chosen": -1.1114013195037842,
"logits/rejected": -1.1640136241912842,
"logps/chosen": -405.6499938964844,
"logps/rejected": -546.8499755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.98828125,
"rewards/margins": 18.870311737060547,
"rewards/rejected": -23.865625381469727,
"step": 9230
},
{
"epoch": 3.964274219504345,
"grad_norm": 0.007751701127611905,
"learning_rate": 8.69098712446352e-09,
"logits/chosen": -1.10498046875,
"logits/rejected": -1.1596190929412842,
"logps/chosen": -410.92498779296875,
"logps/rejected": -585.5499877929688,
"loss": 0.0216,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.873486518859863,
"rewards/margins": 18.854686737060547,
"rewards/rejected": -24.717187881469727,
"step": 9240
},
{
"epoch": 3.968565604548868,
"grad_norm": 0.021010697026064194,
"learning_rate": 7.61802575107296e-09,
"logits/chosen": -1.1213867664337158,
"logits/rejected": -1.1759765148162842,
"logps/chosen": -414.07501220703125,
"logps/rejected": -579.6500244140625,
"loss": 0.0088,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.167773246765137,
"rewards/margins": 18.953125,
"rewards/rejected": -24.131250381469727,
"step": 9250
},
{
"epoch": 3.9728569895933914,
"grad_norm": 0.4471115466545836,
"learning_rate": 6.545064377682403e-09,
"logits/chosen": -1.13018798828125,
"logits/rejected": -1.1712524890899658,
"logps/chosen": -453.7250061035156,
"logps/rejected": -580.2000122070312,
"loss": 0.0053,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.656396389007568,
"rewards/margins": 19.264062881469727,
"rewards/rejected": -24.928125381469727,
"step": 9260
},
{
"epoch": 3.977148374637914,
"grad_norm": 0.006739333990448072,
"learning_rate": 5.4721030042918455e-09,
"logits/chosen": -1.0823974609375,
"logits/rejected": -1.1277344226837158,
"logps/chosen": -428.2749938964844,
"logps/rejected": -596.4000244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.913866996765137,
"rewards/margins": 19.3046875,
"rewards/rejected": -24.223438262939453,
"step": 9270
},
{
"epoch": 3.9814397596824374,
"grad_norm": 0.0057730693487199666,
"learning_rate": 4.399141630901287e-09,
"logits/chosen": -1.19189453125,
"logits/rejected": -1.2080078125,
"logps/chosen": -414.2124938964844,
"logps/rejected": -621.0499877929688,
"loss": 0.0048,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.322363376617432,
"rewards/margins": 19.765625,
"rewards/rejected": -25.095312118530273,
"step": 9280
},
{
"epoch": 3.9857311447269606,
"grad_norm": 0.038885102751617884,
"learning_rate": 3.3261802575107295e-09,
"logits/chosen": -1.110742211341858,
"logits/rejected": -1.1547362804412842,
"logps/chosen": -426.38751220703125,
"logps/rejected": -619.0999755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.202246189117432,
"rewards/margins": 20.028125762939453,
"rewards/rejected": -25.223438262939453,
"step": 9290
},
{
"epoch": 3.9900225297714838,
"grad_norm": 0.0033490480018467236,
"learning_rate": 2.2532188841201715e-09,
"logits/chosen": -1.171484351158142,
"logits/rejected": -1.1748046875,
"logps/chosen": -415.54998779296875,
"logps/rejected": -554.0,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.995409965515137,
"rewards/margins": 18.40625,
"rewards/rejected": -23.401561737060547,
"step": 9300
},
{
"epoch": 3.994313914816007,
"grad_norm": 0.005656690901700299,
"learning_rate": 1.1802575107296135e-09,
"logits/chosen": -1.192480444908142,
"logits/rejected": -1.225976586341858,
"logps/chosen": -417.6000061035156,
"logps/rejected": -604.9500122070312,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.453711032867432,
"rewards/margins": 19.671875,
"rewards/rejected": -25.118749618530273,
"step": 9310
},
{
"epoch": 3.99860529986053,
"grad_norm": 2.1753181183889985,
"learning_rate": 1.0729613733905578e-10,
"logits/chosen": -1.1315429210662842,
"logits/rejected": -1.206640601158142,
"logps/chosen": -410.875,
"logps/rejected": -560.0,
"loss": 0.0177,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.658984184265137,
"rewards/margins": 19.8203125,
"rewards/rejected": -25.481250762939453,
"step": 9320
}
],
"logging_steps": 10,
"max_steps": 9320,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}