5456es's picture
Upload trainer_state.json with huggingface_hub
e1b4de0 verified
Raw History Blame Contribute Delete
325 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.9977470228516254,
"eval_steps": 500,
"global_step": 6212,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.006437077566784679,
"grad_norm": 120.16608464445075,
"learning_rate": 9.98551191242756e-07,
"logits/chosen": -0.5285888910293579,
"logits/rejected": -0.550219714641571,
"logps/chosen": -367.70001220703125,
"logps/rejected": -355.82501220703125,
"loss": 0.6736,
"rewards/accuracies": 0.3812499940395355,
"rewards/chosen": -0.07652588188648224,
"rewards/margins": 0.06703948974609375,
"rewards/rejected": -0.1435089111328125,
"step": 10
},
{
"epoch": 0.012874155133569359,
"grad_norm": 135.5669189775458,
"learning_rate": 9.96941403734707e-07,
"logits/chosen": -0.5475219488143921,
"logits/rejected": -0.556469738483429,
"logps/chosen": -368.625,
"logps/rejected": -344.0,
"loss": 0.6127,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -0.3770507872104645,
"rewards/margins": 0.3885040283203125,
"rewards/rejected": -0.7652343511581421,
"step": 20
},
{
"epoch": 0.01931123270035404,
"grad_norm": 137.23954540855013,
"learning_rate": 9.953316162266581e-07,
"logits/chosen": -0.4871459901332855,
"logits/rejected": -0.5256897211074829,
"logps/chosen": -347.4750061035156,
"logps/rejected": -340.875,
"loss": 0.5851,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.0062271119095385075,
"rewards/margins": 0.5819091796875,
"rewards/rejected": -0.5878967046737671,
"step": 30
},
{
"epoch": 0.025748310267138717,
"grad_norm": 162.8825460193566,
"learning_rate": 9.93721828718609e-07,
"logits/chosen": -0.540789783000946,
"logits/rejected": -0.5523315668106079,
"logps/chosen": -392.82501220703125,
"logps/rejected": -339.5874938964844,
"loss": 0.6844,
"rewards/accuracies": 0.5687500238418579,
"rewards/chosen": -0.02431030198931694,
"rewards/margins": 0.4530700743198395,
"rewards/rejected": -0.4765075743198395,
"step": 40
},
{
"epoch": 0.0321853878339234,
"grad_norm": 111.36198187326185,
"learning_rate": 9.9211204121056e-07,
"logits/chosen": -0.5651000738143921,
"logits/rejected": -0.560577392578125,
"logps/chosen": -364.45001220703125,
"logps/rejected": -334.11248779296875,
"loss": 0.5565,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.3750457763671875,
"rewards/margins": 0.7763427495956421,
"rewards/rejected": -0.401620477437973,
"step": 50
},
{
"epoch": 0.03862246540070808,
"grad_norm": 99.12262240934288,
"learning_rate": 9.905022537025112e-07,
"logits/chosen": -0.4527038633823395,
"logits/rejected": -0.4679809510707855,
"logps/chosen": -359.25,
"logps/rejected": -340.92498779296875,
"loss": 0.6116,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": 0.714129626750946,
"rewards/margins": 0.6304260492324829,
"rewards/rejected": 0.08298339694738388,
"step": 60
},
{
"epoch": 0.04505954296749276,
"grad_norm": 88.34508629839479,
"learning_rate": 9.888924661944624e-07,
"logits/chosen": -0.48187255859375,
"logits/rejected": -0.49010008573532104,
"logps/chosen": -346.2250061035156,
"logps/rejected": -339.4624938964844,
"loss": 0.5153,
"rewards/accuracies": 0.7437499761581421,
"rewards/chosen": 0.822558581829071,
"rewards/margins": 0.859326183795929,
"rewards/rejected": -0.03675537183880806,
"step": 70
},
{
"epoch": 0.051496620534277435,
"grad_norm": 111.01162050170656,
"learning_rate": 9.872826786864134e-07,
"logits/chosen": -0.545391857624054,
"logits/rejected": -0.537060558795929,
"logps/chosen": -408.15625,
"logps/rejected": -402.45001220703125,
"loss": 0.5767,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": 0.3031005859375,
"rewards/margins": 0.9102783203125,
"rewards/rejected": -0.6064819097518921,
"step": 80
},
{
"epoch": 0.057933698101062116,
"grad_norm": 99.33785963112945,
"learning_rate": 9.856728911783643e-07,
"logits/chosen": -0.57373046875,
"logits/rejected": -0.5748535394668579,
"logps/chosen": -393.45001220703125,
"logps/rejected": -360.95001220703125,
"loss": 0.5902,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -0.21026000380516052,
"rewards/margins": 0.7870117425918579,
"rewards/rejected": -0.997509777545929,
"step": 90
},
{
"epoch": 0.0643707756678468,
"grad_norm": 99.12075537368256,
"learning_rate": 9.840631036703153e-07,
"logits/chosen": -0.523236095905304,
"logits/rejected": -0.5228271484375,
"logps/chosen": -348.42498779296875,
"logps/rejected": -317.54998779296875,
"loss": 0.6495,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.176036074757576,
"rewards/margins": 0.4732727110385895,
"rewards/rejected": -0.6496826410293579,
"step": 100
},
{
"epoch": 0.07080785323463147,
"grad_norm": 115.52409219899631,
"learning_rate": 9.824533161622665e-07,
"logits/chosen": -0.4966674745082855,
"logits/rejected": -0.5160156488418579,
"logps/chosen": -362.0249938964844,
"logps/rejected": -325.75,
"loss": 0.6544,
"rewards/accuracies": 0.5874999761581421,
"rewards/chosen": 0.4094482362270355,
"rewards/margins": 0.36219483613967896,
"rewards/rejected": 0.0468292236328125,
"step": 110
},
{
"epoch": 0.07724493080141616,
"grad_norm": 108.91370235062881,
"learning_rate": 9.808435286542177e-07,
"logits/chosen": -0.533123791217804,
"logits/rejected": -0.561358630657196,
"logps/chosen": -368.6499938964844,
"logps/rejected": -338.875,
"loss": 0.5637,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.9539794921875,
"rewards/margins": 0.5897582769393921,
"rewards/rejected": 0.3646179139614105,
"step": 120
},
{
"epoch": 0.08368200836820083,
"grad_norm": 86.74166714430766,
"learning_rate": 9.792337411461686e-07,
"logits/chosen": -0.45283204317092896,
"logits/rejected": -0.47824400663375854,
"logps/chosen": -350.3999938964844,
"logps/rejected": -337.0249938964844,
"loss": 0.647,
"rewards/accuracies": 0.5687500238418579,
"rewards/chosen": 0.527966320514679,
"rewards/margins": 0.5209716558456421,
"rewards/rejected": 0.0069335936568677425,
"step": 130
},
{
"epoch": 0.09011908593498552,
"grad_norm": 103.64877138648835,
"learning_rate": 9.776239536381196e-07,
"logits/chosen": -0.5349365472793579,
"logits/rejected": -0.564208984375,
"logps/chosen": -401.625,
"logps/rejected": -352.07501220703125,
"loss": 0.5847,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.16360779106616974,
"rewards/margins": 0.592480480670929,
"rewards/rejected": -0.7553344964981079,
"step": 140
},
{
"epoch": 0.0965561635017702,
"grad_norm": 116.65061603445305,
"learning_rate": 9.760141661300708e-07,
"logits/chosen": -0.4708251953125,
"logits/rejected": -0.4907592833042145,
"logps/chosen": -364.95001220703125,
"logps/rejected": -327.5249938964844,
"loss": 0.5924,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10672607272863388,
"rewards/margins": 0.5644897222518921,
"rewards/rejected": -0.4580444395542145,
"step": 150
},
{
"epoch": 0.10299324106855487,
"grad_norm": 81.12322692751495,
"learning_rate": 9.744043786220218e-07,
"logits/chosen": -0.5120483636856079,
"logits/rejected": -0.5198394656181335,
"logps/chosen": -359.8500061035156,
"logps/rejected": -337.11248779296875,
"loss": 0.5912,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.36287230253219604,
"rewards/margins": 0.609118640422821,
"rewards/rejected": -0.24659423530101776,
"step": 160
},
{
"epoch": 0.10943031863533956,
"grad_norm": 74.31516061519605,
"learning_rate": 9.72794591113973e-07,
"logits/chosen": -0.5851074457168579,
"logits/rejected": -0.5960327386856079,
"logps/chosen": -374.1000061035156,
"logps/rejected": -360.8500061035156,
"loss": 0.5686,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": 0.30054932832717896,
"rewards/margins": 0.8222290277481079,
"rewards/rejected": -0.5218139886856079,
"step": 170
},
{
"epoch": 0.11586739620212423,
"grad_norm": 113.20782415215908,
"learning_rate": 9.71184803605924e-07,
"logits/chosen": -0.5738281011581421,
"logits/rejected": -0.579742431640625,
"logps/chosen": -387.3500061035156,
"logps/rejected": -373.2250061035156,
"loss": 0.6087,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.24147339165210724,
"rewards/margins": 0.787463366985321,
"rewards/rejected": -0.5462890863418579,
"step": 180
},
{
"epoch": 0.12230447376890892,
"grad_norm": 130.1431697433103,
"learning_rate": 9.69575016097875e-07,
"logits/chosen": -0.583453357219696,
"logits/rejected": -0.5979553461074829,
"logps/chosen": -372.29998779296875,
"logps/rejected": -363.6000061035156,
"loss": 0.6054,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": 0.41649168729782104,
"rewards/margins": 1.0996825695037842,
"rewards/rejected": -0.683605968952179,
"step": 190
},
{
"epoch": 0.1287415513356936,
"grad_norm": 91.70486267908973,
"learning_rate": 9.67965228589826e-07,
"logits/chosen": -0.5898193120956421,
"logits/rejected": -0.587890625,
"logps/chosen": -408.375,
"logps/rejected": -347.3999938964844,
"loss": 0.5409,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": 0.648663341999054,
"rewards/margins": 1.29571533203125,
"rewards/rejected": -0.64654541015625,
"step": 200
},
{
"epoch": 0.13517862890247828,
"grad_norm": 130.11983466346078,
"learning_rate": 9.663554410817772e-07,
"logits/chosen": -0.4863647520542145,
"logits/rejected": -0.539746105670929,
"logps/chosen": -347.0375061035156,
"logps/rejected": -338.32501220703125,
"loss": 0.6107,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": 0.397308349609375,
"rewards/margins": 0.7805420160293579,
"rewards/rejected": -0.38372802734375,
"step": 210
},
{
"epoch": 0.14161570646926294,
"grad_norm": 75.88348717635424,
"learning_rate": 9.647456535737282e-07,
"logits/chosen": -0.4582275450229645,
"logits/rejected": -0.49046629667282104,
"logps/chosen": -374.8500061035156,
"logps/rejected": -359.04998779296875,
"loss": 0.5886,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": 0.744860827922821,
"rewards/margins": 0.8912719488143921,
"rewards/rejected": -0.14583739638328552,
"step": 220
},
{
"epoch": 0.14805278403604763,
"grad_norm": 72.21523489539429,
"learning_rate": 9.631358660656794e-07,
"logits/chosen": -0.4630493223667145,
"logits/rejected": -0.4919677674770355,
"logps/chosen": -342.1875,
"logps/rejected": -331.42498779296875,
"loss": 0.6393,
"rewards/accuracies": 0.5874999761581421,
"rewards/chosen": 0.988513171672821,
"rewards/margins": 0.6120818853378296,
"rewards/rejected": 0.3760314881801605,
"step": 230
},
{
"epoch": 0.15448986160283232,
"grad_norm": 96.90032768184547,
"learning_rate": 9.615260785576303e-07,
"logits/chosen": -0.5086669921875,
"logits/rejected": -0.520275890827179,
"logps/chosen": -369.5375061035156,
"logps/rejected": -331.95001220703125,
"loss": 0.6711,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": 0.80767822265625,
"rewards/margins": 0.4611572325229645,
"rewards/rejected": 0.3460754454135895,
"step": 240
},
{
"epoch": 0.160926939169617,
"grad_norm": 117.88627280563217,
"learning_rate": 9.599162910495813e-07,
"logits/chosen": -0.578723132610321,
"logits/rejected": -0.607922375202179,
"logps/chosen": -410.42498779296875,
"logps/rejected": -369.25,
"loss": 0.6423,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -0.02398681640625,
"rewards/margins": 0.622692883014679,
"rewards/rejected": -0.646209716796875,
"step": 250
},
{
"epoch": 0.16736401673640167,
"grad_norm": 114.49562778791112,
"learning_rate": 9.583065035415325e-07,
"logits/chosen": -0.546374499797821,
"logits/rejected": -0.5821288824081421,
"logps/chosen": -358.5625,
"logps/rejected": -334.8125,
"loss": 0.6349,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": -0.6829162836074829,
"rewards/margins": 0.758496105670929,
"rewards/rejected": -1.4420654773712158,
"step": 260
},
{
"epoch": 0.17380109430318635,
"grad_norm": 252.1668555560546,
"learning_rate": 9.566967160334835e-07,
"logits/chosen": -0.496002197265625,
"logits/rejected": -0.529162585735321,
"logps/chosen": -341.23748779296875,
"logps/rejected": -344.5687561035156,
"loss": 0.6088,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.3066039979457855,
"rewards/margins": 0.724609375,
"rewards/rejected": -1.030542016029358,
"step": 270
},
{
"epoch": 0.18023817186997104,
"grad_norm": 102.98363396913689,
"learning_rate": 9.550869285254346e-07,
"logits/chosen": -0.546069324016571,
"logits/rejected": -0.558239758014679,
"logps/chosen": -370.57501220703125,
"logps/rejected": -368.75,
"loss": 0.5405,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": 0.058502197265625,
"rewards/margins": 0.809436023235321,
"rewards/rejected": -0.751208484172821,
"step": 280
},
{
"epoch": 0.1866752494367557,
"grad_norm": 91.00041151449058,
"learning_rate": 9.534771410173856e-07,
"logits/chosen": -0.577075183391571,
"logits/rejected": -0.5903075933456421,
"logps/chosen": -375.0,
"logps/rejected": -360.98748779296875,
"loss": 0.6413,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": 0.1882476806640625,
"rewards/margins": 0.7995971441268921,
"rewards/rejected": -0.612011730670929,
"step": 290
},
{
"epoch": 0.1931123270035404,
"grad_norm": 102.0109893516658,
"learning_rate": 9.518673535093368e-07,
"logits/chosen": -0.4876770079135895,
"logits/rejected": -0.489013671875,
"logps/chosen": -374.79998779296875,
"logps/rejected": -336.17498779296875,
"loss": 0.618,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.07204589992761612,
"rewards/margins": 0.842114269733429,
"rewards/rejected": -0.770495593547821,
"step": 300
},
{
"epoch": 0.19954940457032508,
"grad_norm": 76.86741916960312,
"learning_rate": 9.502575660012879e-07,
"logits/chosen": -0.5677276849746704,
"logits/rejected": -0.5572754144668579,
"logps/chosen": -359.3999938964844,
"logps/rejected": -367.92498779296875,
"loss": 0.6237,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": 0.3591064512729645,
"rewards/margins": 0.6754516363143921,
"rewards/rejected": -0.3162597715854645,
"step": 310
},
{
"epoch": 0.20598648213710974,
"grad_norm": 108.9030110579976,
"learning_rate": 9.486477784932388e-07,
"logits/chosen": -0.6708739995956421,
"logits/rejected": -0.655590832233429,
"logps/chosen": -376.125,
"logps/rejected": -373.375,
"loss": 0.5166,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.2652526795864105,
"rewards/margins": 1.1403319835662842,
"rewards/rejected": -0.8749328851699829,
"step": 320
},
{
"epoch": 0.21242355970389443,
"grad_norm": 107.07521441276505,
"learning_rate": 9.470379909851899e-07,
"logits/chosen": -0.5230712890625,
"logits/rejected": -0.551342785358429,
"logps/chosen": -373.09375,
"logps/rejected": -354.7875061035156,
"loss": 0.6214,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": -0.1680450439453125,
"rewards/margins": 0.9344116449356079,
"rewards/rejected": -1.102380394935608,
"step": 330
},
{
"epoch": 0.21886063727067911,
"grad_norm": 80.28388865404655,
"learning_rate": 9.454282034771411e-07,
"logits/chosen": -0.6387573480606079,
"logits/rejected": -0.661419689655304,
"logps/chosen": -365.1499938964844,
"logps/rejected": -351.125,
"loss": 0.5976,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.03964843600988388,
"rewards/margins": 0.987072765827179,
"rewards/rejected": -1.0261566638946533,
"step": 340
},
{
"epoch": 0.2252977148374638,
"grad_norm": 66.301132685081,
"learning_rate": 9.43818415969092e-07,
"logits/chosen": -0.5279541015625,
"logits/rejected": -0.5782226324081421,
"logps/chosen": -373.9750061035156,
"logps/rejected": -359.0249938964844,
"loss": 0.5829,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.40840452909469604,
"rewards/margins": 0.9593750238418579,
"rewards/rejected": -0.552032470703125,
"step": 350
},
{
"epoch": 0.23173479240424846,
"grad_norm": 133.60786340460766,
"learning_rate": 9.422086284610431e-07,
"logits/chosen": -0.4904952943325043,
"logits/rejected": -0.4936676025390625,
"logps/chosen": -351.54998779296875,
"logps/rejected": -352.1875,
"loss": 0.6358,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.3689941465854645,
"rewards/margins": 0.801318347454071,
"rewards/rejected": -0.43192750215530396,
"step": 360
},
{
"epoch": 0.23817186997103315,
"grad_norm": 146.73254711353752,
"learning_rate": 9.405988409529941e-07,
"logits/chosen": -0.4536499083042145,
"logits/rejected": -0.48334044218063354,
"logps/chosen": -394.20001220703125,
"logps/rejected": -344.3999938964844,
"loss": 0.622,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.44520872831344604,
"rewards/margins": 0.8761352300643921,
"rewards/rejected": -0.43049317598342896,
"step": 370
},
{
"epoch": 0.24460894753781784,
"grad_norm": 108.12091497250533,
"learning_rate": 9.389890534449453e-07,
"logits/chosen": -0.48052978515625,
"logits/rejected": -0.48167723417282104,
"logps/chosen": -388.875,
"logps/rejected": -367.875,
"loss": 0.5671,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.10392455756664276,
"rewards/margins": 0.9621337652206421,
"rewards/rejected": -0.858563244342804,
"step": 380
},
{
"epoch": 0.2510460251046025,
"grad_norm": 85.66165714869449,
"learning_rate": 9.373792659368963e-07,
"logits/chosen": -0.504321277141571,
"logits/rejected": -0.52301025390625,
"logps/chosen": -362.92498779296875,
"logps/rejected": -352.42498779296875,
"loss": 0.5526,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.561572253704071,
"rewards/margins": 1.221276879310608,
"rewards/rejected": -1.7831909656524658,
"step": 390
},
{
"epoch": 0.2574831026713872,
"grad_norm": 136.73196581533503,
"learning_rate": 9.357694784288473e-07,
"logits/chosen": -0.49071043729782104,
"logits/rejected": -0.51934814453125,
"logps/chosen": -366.36248779296875,
"logps/rejected": -363.25,
"loss": 0.6429,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -0.3850997984409332,
"rewards/margins": 1.0957520008087158,
"rewards/rejected": -1.481896996498108,
"step": 400
},
{
"epoch": 0.2639201802381719,
"grad_norm": 62.68096976935343,
"learning_rate": 9.341596909207984e-07,
"logits/chosen": -0.4698120057582855,
"logits/rejected": -0.49330443143844604,
"logps/chosen": -373.75,
"logps/rejected": -357.20001220703125,
"loss": 0.554,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.1954345703125,
"rewards/margins": 0.96142578125,
"rewards/rejected": -1.1562988758087158,
"step": 410
},
{
"epoch": 0.27035725780495656,
"grad_norm": 117.58664324623555,
"learning_rate": 9.325499034127496e-07,
"logits/chosen": -0.5307983160018921,
"logits/rejected": -0.5357711911201477,
"logps/chosen": -402.75,
"logps/rejected": -393.67498779296875,
"loss": 0.5572,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.15812988579273224,
"rewards/margins": 1.0307495594024658,
"rewards/rejected": -1.1893126964569092,
"step": 420
},
{
"epoch": 0.27679433537174125,
"grad_norm": 93.75687305331235,
"learning_rate": 9.309401159047005e-07,
"logits/chosen": -0.5401611328125,
"logits/rejected": -0.578295886516571,
"logps/chosen": -353.67498779296875,
"logps/rejected": -350.29998779296875,
"loss": 0.697,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": -0.4753173887729645,
"rewards/margins": 0.94769287109375,
"rewards/rejected": -1.422509789466858,
"step": 430
},
{
"epoch": 0.2832314129385259,
"grad_norm": 95.5374818544099,
"learning_rate": 9.293303283966516e-07,
"logits/chosen": -0.619433581829071,
"logits/rejected": -0.6208251714706421,
"logps/chosen": -394.98748779296875,
"logps/rejected": -389.11248779296875,
"loss": 0.6189,
"rewards/accuracies": 0.6187499761581421,
"rewards/chosen": -0.571759045124054,
"rewards/margins": 0.7771240472793579,
"rewards/rejected": -1.349853515625,
"step": 440
},
{
"epoch": 0.28966849050531057,
"grad_norm": 125.84423019681405,
"learning_rate": 9.277205408886027e-07,
"logits/chosen": -0.53460693359375,
"logits/rejected": -0.530902087688446,
"logps/chosen": -368.8999938964844,
"logps/rejected": -367.3500061035156,
"loss": 0.627,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": -0.482666015625,
"rewards/margins": 1.0159423351287842,
"rewards/rejected": -1.497259497642517,
"step": 450
},
{
"epoch": 0.29610556807209526,
"grad_norm": 119.6694420609397,
"learning_rate": 9.261107533805537e-07,
"logits/chosen": -0.5695999264717102,
"logits/rejected": -0.574688732624054,
"logps/chosen": -392.45001220703125,
"logps/rejected": -376.875,
"loss": 0.6691,
"rewards/accuracies": 0.612500011920929,
"rewards/chosen": -0.489309698343277,
"rewards/margins": 0.785595715045929,
"rewards/rejected": -1.275183081626892,
"step": 460
},
{
"epoch": 0.30254264563887995,
"grad_norm": 109.69479101002719,
"learning_rate": 9.245009658725048e-07,
"logits/chosen": -0.5947021245956421,
"logits/rejected": -0.5928710699081421,
"logps/chosen": -404.1625061035156,
"logps/rejected": -355.2749938964844,
"loss": 0.6002,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.16807861626148224,
"rewards/margins": 0.9239562749862671,
"rewards/rejected": -1.091485619544983,
"step": 470
},
{
"epoch": 0.30897972320566464,
"grad_norm": 114.73014097944892,
"learning_rate": 9.228911783644559e-07,
"logits/chosen": -0.572558581829071,
"logits/rejected": -0.602734386920929,
"logps/chosen": -368.2749938964844,
"logps/rejected": -358.1499938964844,
"loss": 0.5264,
"rewards/accuracies": 0.731249988079071,
"rewards/chosen": 0.10758056491613388,
"rewards/margins": 1.0086791515350342,
"rewards/rejected": -0.9011077880859375,
"step": 480
},
{
"epoch": 0.3154168007724493,
"grad_norm": 127.76637945406556,
"learning_rate": 9.212813908564069e-07,
"logits/chosen": -0.54168701171875,
"logits/rejected": -0.570635974407196,
"logps/chosen": -363.2875061035156,
"logps/rejected": -343.17498779296875,
"loss": 0.6542,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": 0.015155029483139515,
"rewards/margins": 0.724200427532196,
"rewards/rejected": -0.708392322063446,
"step": 490
},
{
"epoch": 0.321853878339234,
"grad_norm": 92.4760176391222,
"learning_rate": 9.19671603348358e-07,
"logits/chosen": -0.5834716558456421,
"logits/rejected": -0.608386218547821,
"logps/chosen": -370.13751220703125,
"logps/rejected": -359.7749938964844,
"loss": 0.6958,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": -0.02927246131002903,
"rewards/margins": 0.681835949420929,
"rewards/rejected": -0.7109962701797485,
"step": 500
},
{
"epoch": 0.32829095590601864,
"grad_norm": 120.62329927967555,
"learning_rate": 9.18061815840309e-07,
"logits/chosen": -0.5348449945449829,
"logits/rejected": -0.5554443597793579,
"logps/chosen": -365.8999938964844,
"logps/rejected": -356.29998779296875,
"loss": 0.5751,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.2884887754917145,
"rewards/margins": 0.861279308795929,
"rewards/rejected": -0.5736328363418579,
"step": 510
},
{
"epoch": 0.33472803347280333,
"grad_norm": 130.9763223613383,
"learning_rate": 9.164520283322601e-07,
"logits/chosen": -0.451071172952652,
"logits/rejected": -0.48179322481155396,
"logps/chosen": -363.6000061035156,
"logps/rejected": -347.92498779296875,
"loss": 0.6538,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": 0.3598876893520355,
"rewards/margins": 0.71923828125,
"rewards/rejected": -0.359466552734375,
"step": 520
},
{
"epoch": 0.341165111039588,
"grad_norm": 109.62659240266296,
"learning_rate": 9.148422408242112e-07,
"logits/chosen": -0.4910888671875,
"logits/rejected": -0.519116222858429,
"logps/chosen": -358.5,
"logps/rejected": -364.45001220703125,
"loss": 0.6195,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.5476440191268921,
"rewards/margins": 0.73748779296875,
"rewards/rejected": -0.19072571396827698,
"step": 530
},
{
"epoch": 0.3476021886063727,
"grad_norm": 109.68298542748705,
"learning_rate": 9.132324533161622e-07,
"logits/chosen": -0.4764648377895355,
"logits/rejected": -0.502703845500946,
"logps/chosen": -336.875,
"logps/rejected": -318.25,
"loss": 0.64,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": 0.613238513469696,
"rewards/margins": 0.6423705816268921,
"rewards/rejected": -0.02930908277630806,
"step": 540
},
{
"epoch": 0.3540392661731574,
"grad_norm": 105.51467874045339,
"learning_rate": 9.116226658081133e-07,
"logits/chosen": -0.5284057855606079,
"logits/rejected": -0.5428222417831421,
"logps/chosen": -361.125,
"logps/rejected": -332.3500061035156,
"loss": 0.5463,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": 0.4479126036167145,
"rewards/margins": 1.0054442882537842,
"rewards/rejected": -0.558178722858429,
"step": 550
},
{
"epoch": 0.3604763437399421,
"grad_norm": 99.67713382177797,
"learning_rate": 9.100128783000644e-07,
"logits/chosen": -0.5566619634628296,
"logits/rejected": -0.5879882574081421,
"logps/chosen": -348.375,
"logps/rejected": -369.625,
"loss": 0.5016,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.610461413860321,
"rewards/margins": 1.308984398841858,
"rewards/rejected": -0.698779284954071,
"step": 560
},
{
"epoch": 0.3669134213067268,
"grad_norm": 131.25070143478592,
"learning_rate": 9.084030907920153e-07,
"logits/chosen": -0.5046325922012329,
"logits/rejected": -0.545117199420929,
"logps/chosen": -364.75,
"logps/rejected": -372.5249938964844,
"loss": 0.6631,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": 0.550830066204071,
"rewards/margins": 0.9921020269393921,
"rewards/rejected": -0.4401001036167145,
"step": 570
},
{
"epoch": 0.3733504988735114,
"grad_norm": 109.14671818372386,
"learning_rate": 9.067933032839665e-07,
"logits/chosen": -0.4894042909145355,
"logits/rejected": -0.4809204041957855,
"logps/chosen": -340.4624938964844,
"logps/rejected": -360.8500061035156,
"loss": 0.6645,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.671185314655304,
"rewards/margins": 0.7091064453125,
"rewards/rejected": -0.03690185397863388,
"step": 580
},
{
"epoch": 0.3797875764402961,
"grad_norm": 102.87805305261952,
"learning_rate": 9.051835157759176e-07,
"logits/chosen": -0.6076415777206421,
"logits/rejected": -0.63128662109375,
"logps/chosen": -394.92498779296875,
"logps/rejected": -383.4375,
"loss": 0.581,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": 0.48107606172561646,
"rewards/margins": 1.0627930164337158,
"rewards/rejected": -0.581591784954071,
"step": 590
},
{
"epoch": 0.3862246540070808,
"grad_norm": 101.2501221806809,
"learning_rate": 9.035737282678686e-07,
"logits/chosen": -0.606689453125,
"logits/rejected": -0.617114245891571,
"logps/chosen": -325.23748779296875,
"logps/rejected": -309.0874938964844,
"loss": 0.599,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.31675416231155396,
"rewards/margins": 0.9888916015625,
"rewards/rejected": -0.671948254108429,
"step": 600
},
{
"epoch": 0.39266173157386547,
"grad_norm": 112.02032310278221,
"learning_rate": 9.019639407598196e-07,
"logits/chosen": -0.5888427495956421,
"logits/rejected": -0.611279308795929,
"logps/chosen": -370.3500061035156,
"logps/rejected": -363.8500061035156,
"loss": 0.5333,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": 0.5602661371231079,
"rewards/margins": 1.0866515636444092,
"rewards/rejected": -0.5262695550918579,
"step": 610
},
{
"epoch": 0.39909880914065016,
"grad_norm": 116.1836878867331,
"learning_rate": 9.003541532517708e-07,
"logits/chosen": -0.561572253704071,
"logits/rejected": -0.577441394329071,
"logps/chosen": -362.29998779296875,
"logps/rejected": -352.7250061035156,
"loss": 0.6513,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": 0.3332366943359375,
"rewards/margins": 0.7449706792831421,
"rewards/rejected": -0.4120422303676605,
"step": 620
},
{
"epoch": 0.40553588670743485,
"grad_norm": 119.84221150272923,
"learning_rate": 8.987443657437218e-07,
"logits/chosen": -0.551226794719696,
"logits/rejected": -0.5623534917831421,
"logps/chosen": -386.70001220703125,
"logps/rejected": -373.07501220703125,
"loss": 0.6302,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.28680419921875,
"rewards/margins": 0.9903320074081421,
"rewards/rejected": -1.2776367664337158,
"step": 630
},
{
"epoch": 0.4119729642742195,
"grad_norm": 119.20355705473106,
"learning_rate": 8.971345782356729e-07,
"logits/chosen": -0.5877685546875,
"logits/rejected": -0.6196533441543579,
"logps/chosen": -386.4750061035156,
"logps/rejected": -392.2250061035156,
"loss": 0.618,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.45903319120407104,
"rewards/margins": 0.8375488519668579,
"rewards/rejected": -1.2969481945037842,
"step": 640
},
{
"epoch": 0.41841004184100417,
"grad_norm": 114.39134560983841,
"learning_rate": 8.955247907276239e-07,
"logits/chosen": -0.4747314453125,
"logits/rejected": -0.520581066608429,
"logps/chosen": -361.45001220703125,
"logps/rejected": -340.42498779296875,
"loss": 0.6872,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.09818115085363388,
"rewards/margins": 0.6923888921737671,
"rewards/rejected": -0.791015625,
"step": 650
},
{
"epoch": 0.42484711940778885,
"grad_norm": 107.98675915515811,
"learning_rate": 8.93915003219575e-07,
"logits/chosen": -0.539172351360321,
"logits/rejected": -0.5562499761581421,
"logps/chosen": -381.54998779296875,
"logps/rejected": -356.75,
"loss": 0.551,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": 0.00932922400534153,
"rewards/margins": 1.1506836414337158,
"rewards/rejected": -1.142364501953125,
"step": 660
},
{
"epoch": 0.43128419697457354,
"grad_norm": 103.2010559979854,
"learning_rate": 8.923052157115261e-07,
"logits/chosen": -0.528704822063446,
"logits/rejected": -0.556774914264679,
"logps/chosen": -388.6000061035156,
"logps/rejected": -368.70001220703125,
"loss": 0.5941,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.13016967475414276,
"rewards/margins": 1.0416138172149658,
"rewards/rejected": -1.172509789466858,
"step": 670
},
{
"epoch": 0.43772127454135823,
"grad_norm": 123.08466573292604,
"learning_rate": 8.90695428203477e-07,
"logits/chosen": -0.5683318972587585,
"logits/rejected": -0.575610339641571,
"logps/chosen": -399.875,
"logps/rejected": -361.45001220703125,
"loss": 0.5778,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.6572631597518921,
"rewards/margins": 1.0535399913787842,
"rewards/rejected": -1.7103271484375,
"step": 680
},
{
"epoch": 0.4441583521081429,
"grad_norm": 83.98215014096604,
"learning_rate": 8.890856406954281e-07,
"logits/chosen": -0.523547351360321,
"logits/rejected": -0.5286010503768921,
"logps/chosen": -384.7749938964844,
"logps/rejected": -357.57501220703125,
"loss": 0.5256,
"rewards/accuracies": 0.7437499761581421,
"rewards/chosen": -0.02643432654440403,
"rewards/margins": 1.292199730873108,
"rewards/rejected": -1.3194580078125,
"step": 690
},
{
"epoch": 0.4505954296749276,
"grad_norm": 104.87203994034158,
"learning_rate": 8.874758531873793e-07,
"logits/chosen": -0.538464367389679,
"logits/rejected": -0.5656677484512329,
"logps/chosen": -364.5625,
"logps/rejected": -369.8999938964844,
"loss": 0.4687,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": 0.04945068433880806,
"rewards/margins": 1.432836890220642,
"rewards/rejected": -1.3836181163787842,
"step": 700
},
{
"epoch": 0.45703250724171224,
"grad_norm": 57.76406203268148,
"learning_rate": 8.858660656793303e-07,
"logits/chosen": -0.512127697467804,
"logits/rejected": -0.5491943359375,
"logps/chosen": -405.0,
"logps/rejected": -395.3374938964844,
"loss": 0.5798,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.303070068359375,
"rewards/margins": 1.1065673828125,
"rewards/rejected": -0.8034912347793579,
"step": 710
},
{
"epoch": 0.4634695848084969,
"grad_norm": 69.89352328895056,
"learning_rate": 8.842562781712813e-07,
"logits/chosen": -0.4332519471645355,
"logits/rejected": -0.45560914278030396,
"logps/chosen": -350.20001220703125,
"logps/rejected": -314.125,
"loss": 0.6324,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.3115478456020355,
"rewards/margins": 0.9028564691543579,
"rewards/rejected": -0.591540515422821,
"step": 720
},
{
"epoch": 0.4699066623752816,
"grad_norm": 83.67294747788176,
"learning_rate": 8.826464906632324e-07,
"logits/chosen": -0.51568603515625,
"logits/rejected": -0.5252624750137329,
"logps/chosen": -381.92498779296875,
"logps/rejected": -349.32501220703125,
"loss": 0.6184,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.4420166015625,
"rewards/margins": 0.99859619140625,
"rewards/rejected": -0.556780993938446,
"step": 730
},
{
"epoch": 0.4763437399420663,
"grad_norm": 104.60759299733223,
"learning_rate": 8.810367031551835e-07,
"logits/chosen": -0.42892152070999146,
"logits/rejected": -0.4578002989292145,
"logps/chosen": -409.29998779296875,
"logps/rejected": -351.3500061035156,
"loss": 0.5794,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.088287353515625,
"rewards/margins": 1.06494140625,
"rewards/rejected": -0.9759521484375,
"step": 740
},
{
"epoch": 0.482780817508851,
"grad_norm": 70.65265994679216,
"learning_rate": 8.794269156471346e-07,
"logits/chosen": -0.4439941346645355,
"logits/rejected": -0.502819836139679,
"logps/chosen": -358.51251220703125,
"logps/rejected": -343.7250061035156,
"loss": 0.603,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.317587286233902,
"rewards/margins": 1.092810034751892,
"rewards/rejected": -0.774609386920929,
"step": 750
},
{
"epoch": 0.4892178950756357,
"grad_norm": 99.48553520919884,
"learning_rate": 8.778171281390856e-07,
"logits/chosen": -0.454559326171875,
"logits/rejected": -0.46809083223342896,
"logps/chosen": -387.20001220703125,
"logps/rejected": -361.875,
"loss": 0.591,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": 0.2822631895542145,
"rewards/margins": 0.992480456829071,
"rewards/rejected": -0.710858166217804,
"step": 760
},
{
"epoch": 0.49565497264242037,
"grad_norm": 107.63172335214213,
"learning_rate": 8.762073406310366e-07,
"logits/chosen": -0.5004516839981079,
"logits/rejected": -0.5167480707168579,
"logps/chosen": -349.20001220703125,
"logps/rejected": -351.1499938964844,
"loss": 0.6649,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": -0.29923707246780396,
"rewards/margins": 0.953686535358429,
"rewards/rejected": -1.253198266029358,
"step": 770
},
{
"epoch": 0.502092050209205,
"grad_norm": 112.79451532298022,
"learning_rate": 8.745975531229878e-07,
"logits/chosen": -0.50775146484375,
"logits/rejected": -0.5383545160293579,
"logps/chosen": -372.2875061035156,
"logps/rejected": -374.7749938964844,
"loss": 0.6127,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.543988049030304,
"rewards/margins": 1.2046020030975342,
"rewards/rejected": -1.748632788658142,
"step": 780
},
{
"epoch": 0.5085291277759897,
"grad_norm": 92.84930514639605,
"learning_rate": 8.729877656149389e-07,
"logits/chosen": -0.511303722858429,
"logits/rejected": -0.52484130859375,
"logps/chosen": -356.45001220703125,
"logps/rejected": -347.0249938964844,
"loss": 0.5365,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.19889526069164276,
"rewards/margins": 1.256262183189392,
"rewards/rejected": -1.454187035560608,
"step": 790
},
{
"epoch": 0.5149662053427744,
"grad_norm": 118.08576455579058,
"learning_rate": 8.713779781068898e-07,
"logits/chosen": -0.526232898235321,
"logits/rejected": -0.544995129108429,
"logps/chosen": -344.3374938964844,
"logps/rejected": -359.29998779296875,
"loss": 0.567,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.2644104063510895,
"rewards/margins": 1.2300536632537842,
"rewards/rejected": -1.4940307140350342,
"step": 800
},
{
"epoch": 0.5214032829095591,
"grad_norm": 149.5051687226972,
"learning_rate": 8.697681905988409e-07,
"logits/chosen": -0.533679187297821,
"logits/rejected": -0.546582043170929,
"logps/chosen": -416.1000061035156,
"logps/rejected": -381.8500061035156,
"loss": 0.6592,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -0.562670886516571,
"rewards/margins": 0.9259033203125,
"rewards/rejected": -1.48779296875,
"step": 810
},
{
"epoch": 0.5278403604763438,
"grad_norm": 116.30993199121478,
"learning_rate": 8.681584030907921e-07,
"logits/chosen": -0.548510730266571,
"logits/rejected": -0.5396972894668579,
"logps/chosen": -415.82501220703125,
"logps/rejected": -355.17498779296875,
"loss": 0.604,
"rewards/accuracies": 0.612500011920929,
"rewards/chosen": -0.35222166776657104,
"rewards/margins": 0.830737292766571,
"rewards/rejected": -1.182348608970642,
"step": 820
},
{
"epoch": 0.5342774380431284,
"grad_norm": 88.88351113445877,
"learning_rate": 8.66548615582743e-07,
"logits/chosen": -0.41846925020217896,
"logits/rejected": -0.44677734375,
"logps/chosen": -355.38751220703125,
"logps/rejected": -348.2749938964844,
"loss": 0.7307,
"rewards/accuracies": 0.606249988079071,
"rewards/chosen": -0.31745606660842896,
"rewards/margins": 0.7986205816268921,
"rewards/rejected": -1.1161620616912842,
"step": 830
},
{
"epoch": 0.5407145156099131,
"grad_norm": 141.95886167076992,
"learning_rate": 8.649388280746941e-07,
"logits/chosen": -0.4906982481479645,
"logits/rejected": -0.5586181879043579,
"logps/chosen": -411.54998779296875,
"logps/rejected": -367.82501220703125,
"loss": 0.6348,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": 0.28123778104782104,
"rewards/margins": 1.0207641124725342,
"rewards/rejected": -0.7385803461074829,
"step": 840
},
{
"epoch": 0.5471515931766978,
"grad_norm": 119.67858559796636,
"learning_rate": 8.633290405666451e-07,
"logits/chosen": -0.53289794921875,
"logits/rejected": -0.526135265827179,
"logps/chosen": -361.0,
"logps/rejected": -353.1000061035156,
"loss": 0.5787,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.18852539360523224,
"rewards/margins": 1.079687476158142,
"rewards/rejected": -1.2688720226287842,
"step": 850
},
{
"epoch": 0.5535886707434825,
"grad_norm": 106.12475270901847,
"learning_rate": 8.617192530585963e-07,
"logits/chosen": -0.5385986566543579,
"logits/rejected": -0.542651355266571,
"logps/chosen": -427.5375061035156,
"logps/rejected": -417.3999938964844,
"loss": 0.6631,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.42586058378219604,
"rewards/margins": 1.089013695716858,
"rewards/rejected": -1.515173316001892,
"step": 860
},
{
"epoch": 0.5600257483102672,
"grad_norm": 98.81134073733207,
"learning_rate": 8.601094655505473e-07,
"logits/chosen": -0.5274902582168579,
"logits/rejected": -0.522229015827179,
"logps/chosen": -392.29998779296875,
"logps/rejected": -394.5249938964844,
"loss": 0.613,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.3875488340854645,
"rewards/margins": 1.0703125,
"rewards/rejected": -1.4576904773712158,
"step": 870
},
{
"epoch": 0.5664628258770518,
"grad_norm": 120.13198690851658,
"learning_rate": 8.584996780424983e-07,
"logits/chosen": -0.55718994140625,
"logits/rejected": -0.553845226764679,
"logps/chosen": -369.82501220703125,
"logps/rejected": -343.07501220703125,
"loss": 0.639,
"rewards/accuracies": 0.5874999761581421,
"rewards/chosen": -0.23508301377296448,
"rewards/margins": 0.7032836675643921,
"rewards/rejected": -0.939038097858429,
"step": 880
},
{
"epoch": 0.5728999034438365,
"grad_norm": 62.94101570205876,
"learning_rate": 8.568898905344494e-07,
"logits/chosen": -0.4923339784145355,
"logits/rejected": -0.5071777105331421,
"logps/chosen": -350.5874938964844,
"logps/rejected": -328.25,
"loss": 0.602,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.03252258151769638,
"rewards/margins": 0.9979614019393921,
"rewards/rejected": -0.9653381109237671,
"step": 890
},
{
"epoch": 0.5793369810106211,
"grad_norm": 112.45942278359949,
"learning_rate": 8.552801030264006e-07,
"logits/chosen": -0.5096191167831421,
"logits/rejected": -0.4962158203125,
"logps/chosen": -376.375,
"logps/rejected": -356.29998779296875,
"loss": 0.6255,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.581451416015625,
"rewards/margins": 0.798583984375,
"rewards/rejected": -1.37945556640625,
"step": 900
},
{
"epoch": 0.5857740585774058,
"grad_norm": 108.90325211362334,
"learning_rate": 8.536703155183515e-07,
"logits/chosen": -0.552380383014679,
"logits/rejected": -0.5654449462890625,
"logps/chosen": -417.51251220703125,
"logps/rejected": -411.625,
"loss": 0.54,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.811279296875,
"rewards/margins": 1.20068359375,
"rewards/rejected": -2.0130858421325684,
"step": 910
},
{
"epoch": 0.5922111361441905,
"grad_norm": 98.0959184069916,
"learning_rate": 8.520605280103026e-07,
"logits/chosen": -0.5830078125,
"logits/rejected": -0.6092773675918579,
"logps/chosen": -353.6625061035156,
"logps/rejected": -364.67498779296875,
"loss": 0.6542,
"rewards/accuracies": 0.612500011920929,
"rewards/chosen": -0.9505707025527954,
"rewards/margins": 0.778289794921875,
"rewards/rejected": -1.729894995689392,
"step": 920
},
{
"epoch": 0.5986482137109752,
"grad_norm": 99.99889212589564,
"learning_rate": 8.504507405022537e-07,
"logits/chosen": -0.47906494140625,
"logits/rejected": -0.4897399842739105,
"logps/chosen": -379.625,
"logps/rejected": -377.2250061035156,
"loss": 0.6211,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.747698962688446,
"rewards/margins": 1.053491234779358,
"rewards/rejected": -1.801123023033142,
"step": 930
},
{
"epoch": 0.6050852912777599,
"grad_norm": 89.85940157465599,
"learning_rate": 8.488409529942047e-07,
"logits/chosen": -0.526043713092804,
"logits/rejected": -0.553393542766571,
"logps/chosen": -363.2250061035156,
"logps/rejected": -347.8999938964844,
"loss": 0.5999,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": -0.332254022359848,
"rewards/margins": 1.034509301185608,
"rewards/rejected": -1.367010474205017,
"step": 940
},
{
"epoch": 0.6115223688445446,
"grad_norm": 70.14280663264151,
"learning_rate": 8.472311654861558e-07,
"logits/chosen": -0.6128768920898438,
"logits/rejected": -0.6567413210868835,
"logps/chosen": -391.5,
"logps/rejected": -375.8500061035156,
"loss": 0.5634,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.06875000149011612,
"rewards/margins": 1.0836913585662842,
"rewards/rejected": -1.152441382408142,
"step": 950
},
{
"epoch": 0.6179594464113293,
"grad_norm": 120.47345616509051,
"learning_rate": 8.456213779781069e-07,
"logits/chosen": -0.5240844488143921,
"logits/rejected": -0.5285888910293579,
"logps/chosen": -332.4125061035156,
"logps/rejected": -343.63751220703125,
"loss": 0.6299,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.15395812690258026,
"rewards/margins": 1.132959008216858,
"rewards/rejected": -1.2863037586212158,
"step": 960
},
{
"epoch": 0.624396523978114,
"grad_norm": 92.26766562500985,
"learning_rate": 8.440115904700579e-07,
"logits/chosen": -0.578857421875,
"logits/rejected": -0.598950207233429,
"logps/chosen": -400.1000061035156,
"logps/rejected": -380.45001220703125,
"loss": 0.6269,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.084320068359375,
"rewards/margins": 1.0315673351287842,
"rewards/rejected": -0.947705090045929,
"step": 970
},
{
"epoch": 0.6308336015448986,
"grad_norm": 85.69917047655541,
"learning_rate": 8.42401802962009e-07,
"logits/chosen": -0.6307373046875,
"logits/rejected": -0.6424804925918579,
"logps/chosen": -399.7749938964844,
"logps/rejected": -380.07501220703125,
"loss": 0.5451,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.20753173530101776,
"rewards/margins": 1.097631812095642,
"rewards/rejected": -1.3062012195587158,
"step": 980
},
{
"epoch": 0.6372706791116833,
"grad_norm": 99.91368279665215,
"learning_rate": 8.4079201545396e-07,
"logits/chosen": -0.53326416015625,
"logits/rejected": -0.5157104730606079,
"logps/chosen": -370.75,
"logps/rejected": -344.92498779296875,
"loss": 0.6636,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.07122802734375,
"rewards/margins": 0.891162097454071,
"rewards/rejected": -0.9619506597518921,
"step": 990
},
{
"epoch": 0.643707756678468,
"grad_norm": 111.09429678604513,
"learning_rate": 8.391822279459111e-07,
"logits/chosen": -0.5557830929756165,
"logits/rejected": -0.578845202922821,
"logps/chosen": -386.07501220703125,
"logps/rejected": -370.2250061035156,
"loss": 0.5953,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": -0.06235351413488388,
"rewards/margins": 1.00732421875,
"rewards/rejected": -1.069116234779358,
"step": 1000
},
{
"epoch": 0.6501448342452526,
"grad_norm": 108.22353551131003,
"learning_rate": 8.375724404378622e-07,
"logits/chosen": -0.5925537347793579,
"logits/rejected": -0.598681628704071,
"logps/chosen": -346.75,
"logps/rejected": -322.8999938964844,
"loss": 0.6265,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": -0.20738525688648224,
"rewards/margins": 0.9044555425643921,
"rewards/rejected": -1.1110718250274658,
"step": 1010
},
{
"epoch": 0.6565819118120373,
"grad_norm": 84.63983202639838,
"learning_rate": 8.359626529298132e-07,
"logits/chosen": -0.501538097858429,
"logits/rejected": -0.47550660371780396,
"logps/chosen": -374.3500061035156,
"logps/rejected": -349.63751220703125,
"loss": 0.5603,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.20573119819164276,
"rewards/margins": 0.952099621295929,
"rewards/rejected": -1.15771484375,
"step": 1020
},
{
"epoch": 0.663018989378822,
"grad_norm": 94.59002794744202,
"learning_rate": 8.343528654217643e-07,
"logits/chosen": -0.45048826932907104,
"logits/rejected": -0.44732666015625,
"logps/chosen": -379.25,
"logps/rejected": -379.625,
"loss": 0.6549,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.4843383729457855,
"rewards/margins": 0.846728503704071,
"rewards/rejected": -1.330957055091858,
"step": 1030
},
{
"epoch": 0.6694560669456067,
"grad_norm": 128.4884473761372,
"learning_rate": 8.327430779137154e-07,
"logits/chosen": -0.5034545660018921,
"logits/rejected": -0.524914562702179,
"logps/chosen": -385.2749938964844,
"logps/rejected": -350.29998779296875,
"loss": 0.5829,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": -0.407562255859375,
"rewards/margins": 1.02783203125,
"rewards/rejected": -1.435888648033142,
"step": 1040
},
{
"epoch": 0.6758931445123914,
"grad_norm": 107.25803443764735,
"learning_rate": 8.311332904056663e-07,
"logits/chosen": -0.46173095703125,
"logits/rejected": -0.5187743902206421,
"logps/chosen": -372.2749938964844,
"logps/rejected": -341.04998779296875,
"loss": 0.6023,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.3631958067417145,
"rewards/margins": 1.004797339439392,
"rewards/rejected": -1.368017554283142,
"step": 1050
},
{
"epoch": 0.682330222079176,
"grad_norm": 126.80827854824096,
"learning_rate": 8.295235028976175e-07,
"logits/chosen": -0.47755128145217896,
"logits/rejected": -0.509960949420929,
"logps/chosen": -350.42498779296875,
"logps/rejected": -357.9375,
"loss": 0.6958,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.19310760498046875,
"rewards/margins": 0.7228027582168579,
"rewards/rejected": -0.9160064458847046,
"step": 1060
},
{
"epoch": 0.6887672996459607,
"grad_norm": 81.10373132613064,
"learning_rate": 8.279137153895686e-07,
"logits/chosen": -0.42036741971969604,
"logits/rejected": -0.4339141845703125,
"logps/chosen": -385.1499938964844,
"logps/rejected": -373.45001220703125,
"loss": 0.6191,
"rewards/accuracies": 0.643750011920929,
"rewards/chosen": -0.156494140625,
"rewards/margins": 0.8669067621231079,
"rewards/rejected": -1.024011254310608,
"step": 1070
},
{
"epoch": 0.6952043772127454,
"grad_norm": 54.410337891839184,
"learning_rate": 8.263039278815196e-07,
"logits/chosen": -0.47700196504592896,
"logits/rejected": -0.5096435546875,
"logps/chosen": -364.7749938964844,
"logps/rejected": -334.29998779296875,
"loss": 0.4926,
"rewards/accuracies": 0.7437499761581421,
"rewards/chosen": 0.12125243991613388,
"rewards/margins": 1.276452660560608,
"rewards/rejected": -1.155175805091858,
"step": 1080
},
{
"epoch": 0.7016414547795301,
"grad_norm": 103.66262035258725,
"learning_rate": 8.246941403734706e-07,
"logits/chosen": -0.45051270723342896,
"logits/rejected": -0.4598144590854645,
"logps/chosen": -361.4750061035156,
"logps/rejected": -396.45001220703125,
"loss": 0.6205,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.45460206270217896,
"rewards/margins": 1.1227295398712158,
"rewards/rejected": -1.5778076648712158,
"step": 1090
},
{
"epoch": 0.7080785323463148,
"grad_norm": 110.31202907587142,
"learning_rate": 8.230843528654218e-07,
"logits/chosen": -0.36857908964157104,
"logits/rejected": -0.4070068299770355,
"logps/chosen": -347.8500061035156,
"logps/rejected": -325.8999938964844,
"loss": 0.6092,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -0.662280261516571,
"rewards/margins": 1.011010766029358,
"rewards/rejected": -1.6741943359375,
"step": 1100
},
{
"epoch": 0.7145156099130995,
"grad_norm": 113.5610108186264,
"learning_rate": 8.214745653573728e-07,
"logits/chosen": -0.45977783203125,
"logits/rejected": -0.4886474609375,
"logps/chosen": -422.75,
"logps/rejected": -394.92498779296875,
"loss": 0.5894,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.7705932855606079,
"rewards/margins": 1.0309569835662842,
"rewards/rejected": -1.8014647960662842,
"step": 1110
},
{
"epoch": 0.7209526874798842,
"grad_norm": 123.78507873787207,
"learning_rate": 8.198647778493239e-07,
"logits/chosen": -0.48577880859375,
"logits/rejected": -0.5226074457168579,
"logps/chosen": -393.75,
"logps/rejected": -369.07501220703125,
"loss": 0.5765,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.38194578886032104,
"rewards/margins": 1.10162353515625,
"rewards/rejected": -1.484594702720642,
"step": 1120
},
{
"epoch": 0.7273897650466689,
"grad_norm": 127.99687246016022,
"learning_rate": 8.182549903412748e-07,
"logits/chosen": -0.4909118711948395,
"logits/rejected": -0.4707275331020355,
"logps/chosen": -353.5249938964844,
"logps/rejected": -350.3500061035156,
"loss": 0.6522,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -0.3532470762729645,
"rewards/margins": 0.9039306640625,
"rewards/rejected": -1.257135033607483,
"step": 1130
},
{
"epoch": 0.7338268426134535,
"grad_norm": 100.74894669506055,
"learning_rate": 8.16645202833226e-07,
"logits/chosen": -0.4802612364292145,
"logits/rejected": -0.5090576410293579,
"logps/chosen": -360.29998779296875,
"logps/rejected": -378.67498779296875,
"loss": 0.6234,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": -0.32078856229782104,
"rewards/margins": 1.0515868663787842,
"rewards/rejected": -1.372583031654358,
"step": 1140
},
{
"epoch": 0.7402639201802381,
"grad_norm": 124.88195018416995,
"learning_rate": 8.150354153251771e-07,
"logits/chosen": -0.46788328886032104,
"logits/rejected": -0.4967285096645355,
"logps/chosen": -366.98748779296875,
"logps/rejected": -367.8999938964844,
"loss": 0.6054,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.23341064155101776,
"rewards/margins": 1.050317406654358,
"rewards/rejected": -0.817883312702179,
"step": 1150
},
{
"epoch": 0.7467009977470228,
"grad_norm": 115.48073006138456,
"learning_rate": 8.13425627817128e-07,
"logits/chosen": -0.48234254121780396,
"logits/rejected": -0.49266356229782104,
"logps/chosen": -372.6499938964844,
"logps/rejected": -340.3999938964844,
"loss": 0.538,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.525585949420929,
"rewards/margins": 1.1814696788787842,
"rewards/rejected": -0.655688464641571,
"step": 1160
},
{
"epoch": 0.7531380753138075,
"grad_norm": 85.01864055690064,
"learning_rate": 8.118158403090791e-07,
"logits/chosen": -0.3582519590854645,
"logits/rejected": -0.3791137635707855,
"logps/chosen": -382.1000061035156,
"logps/rejected": -345.29998779296875,
"loss": 0.6241,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": 0.05527343600988388,
"rewards/margins": 1.0609130859375,
"rewards/rejected": -1.0050170421600342,
"step": 1170
},
{
"epoch": 0.7595751528805922,
"grad_norm": 114.9441718662302,
"learning_rate": 8.102060528010303e-07,
"logits/chosen": -0.46600341796875,
"logits/rejected": -0.4788574278354645,
"logps/chosen": -399.51251220703125,
"logps/rejected": -397.3500061035156,
"loss": 0.5901,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.261474609375,
"rewards/margins": 1.3340332508087158,
"rewards/rejected": -1.596215844154358,
"step": 1180
},
{
"epoch": 0.7660122304473769,
"grad_norm": 108.13993143362673,
"learning_rate": 8.085962652929813e-07,
"logits/chosen": -0.45205992460250854,
"logits/rejected": -0.4634765684604645,
"logps/chosen": -386.98748779296875,
"logps/rejected": -358.625,
"loss": 0.6667,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.49949342012405396,
"rewards/margins": 1.317773461341858,
"rewards/rejected": -1.817724585533142,
"step": 1190
},
{
"epoch": 0.7724493080141616,
"grad_norm": 147.08462386802262,
"learning_rate": 8.069864777849323e-07,
"logits/chosen": -0.49937134981155396,
"logits/rejected": -0.505419909954071,
"logps/chosen": -369.0625,
"logps/rejected": -382.4750061035156,
"loss": 0.7564,
"rewards/accuracies": 0.6187499761581421,
"rewards/chosen": -0.2877746522426605,
"rewards/margins": 0.7278076410293579,
"rewards/rejected": -1.015435814857483,
"step": 1200
},
{
"epoch": 0.7788863855809462,
"grad_norm": 115.55623695277468,
"learning_rate": 8.053766902768834e-07,
"logits/chosen": -0.4474243223667145,
"logits/rejected": -0.46574705839157104,
"logps/chosen": -355.86248779296875,
"logps/rejected": -345.07501220703125,
"loss": 0.569,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0020507811568677425,
"rewards/margins": 0.920788586139679,
"rewards/rejected": -0.917816162109375,
"step": 1210
},
{
"epoch": 0.7853234631477309,
"grad_norm": 98.71710653719403,
"learning_rate": 8.037669027688345e-07,
"logits/chosen": -0.484619140625,
"logits/rejected": -0.47932130098342896,
"logps/chosen": -372.7250061035156,
"logps/rejected": -371.20001220703125,
"loss": 0.5893,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -0.21046753227710724,
"rewards/margins": 0.9305664300918579,
"rewards/rejected": -1.142114281654358,
"step": 1220
},
{
"epoch": 0.7917605407145156,
"grad_norm": 116.58967696349914,
"learning_rate": 8.021571152607856e-07,
"logits/chosen": -0.41608887910842896,
"logits/rejected": -0.4575439393520355,
"logps/chosen": -374.63751220703125,
"logps/rejected": -356.92498779296875,
"loss": 0.6804,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": -0.17164306342601776,
"rewards/margins": 0.873791515827179,
"rewards/rejected": -1.045166015625,
"step": 1230
},
{
"epoch": 0.7981976182813003,
"grad_norm": 89.90212458778099,
"learning_rate": 8.005473277527366e-07,
"logits/chosen": -0.47612303495407104,
"logits/rejected": -0.46992188692092896,
"logps/chosen": -382.98748779296875,
"logps/rejected": -376.42498779296875,
"loss": 0.6204,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.11334228515625,
"rewards/margins": 1.0497925281524658,
"rewards/rejected": -1.1633727550506592,
"step": 1240
},
{
"epoch": 0.804634695848085,
"grad_norm": 113.94650452614209,
"learning_rate": 7.989375402446876e-07,
"logits/chosen": -0.4763244688510895,
"logits/rejected": -0.49517822265625,
"logps/chosen": -347.23748779296875,
"logps/rejected": -325.0249938964844,
"loss": 0.623,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.11918945610523224,
"rewards/margins": 0.8921142816543579,
"rewards/rejected": -1.0122039318084717,
"step": 1250
},
{
"epoch": 0.8110717734148697,
"grad_norm": 98.14429996042087,
"learning_rate": 7.973277527366388e-07,
"logits/chosen": -0.4635772705078125,
"logits/rejected": -0.4755493104457855,
"logps/chosen": -373.70001220703125,
"logps/rejected": -357.25,
"loss": 0.6548,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.548840343952179,
"rewards/margins": 0.88629150390625,
"rewards/rejected": -1.435449242591858,
"step": 1260
},
{
"epoch": 0.8175088509816544,
"grad_norm": 97.0864968634607,
"learning_rate": 7.957179652285899e-07,
"logits/chosen": -0.525805652141571,
"logits/rejected": -0.510266125202179,
"logps/chosen": -354.6499938964844,
"logps/rejected": -351.95001220703125,
"loss": 0.5806,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": -0.37434083223342896,
"rewards/margins": 1.059057593345642,
"rewards/rejected": -1.4339721202850342,
"step": 1270
},
{
"epoch": 0.823945928548439,
"grad_norm": 81.72733031375124,
"learning_rate": 7.941081777205408e-07,
"logits/chosen": -0.47092896699905396,
"logits/rejected": -0.47998350858688354,
"logps/chosen": -387.8374938964844,
"logps/rejected": -374.79998779296875,
"loss": 0.5909,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.31041258573532104,
"rewards/margins": 1.3404357433319092,
"rewards/rejected": -1.651647925376892,
"step": 1280
},
{
"epoch": 0.8303830061152236,
"grad_norm": 61.78251081973873,
"learning_rate": 7.924983902124919e-07,
"logits/chosen": -0.3810485899448395,
"logits/rejected": -0.41566163301467896,
"logps/chosen": -376.1000061035156,
"logps/rejected": -358.54998779296875,
"loss": 0.5402,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.06690673530101776,
"rewards/margins": 1.2426269054412842,
"rewards/rejected": -1.310052514076233,
"step": 1290
},
{
"epoch": 0.8368200836820083,
"grad_norm": 109.83631710755957,
"learning_rate": 7.908886027044431e-07,
"logits/chosen": -0.42792969942092896,
"logits/rejected": -0.45692139863967896,
"logps/chosen": -384.875,
"logps/rejected": -376.32501220703125,
"loss": 0.6567,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": -0.03769531100988388,
"rewards/margins": 1.0447266101837158,
"rewards/rejected": -1.082800269126892,
"step": 1300
},
{
"epoch": 0.843257161248793,
"grad_norm": 91.84896650553513,
"learning_rate": 7.89278815196394e-07,
"logits/chosen": -0.36790770292282104,
"logits/rejected": -0.3922485411167145,
"logps/chosen": -359.7749938964844,
"logps/rejected": -365.0249938964844,
"loss": 0.5082,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.12186889350414276,
"rewards/margins": 1.2075378894805908,
"rewards/rejected": -1.328283667564392,
"step": 1310
},
{
"epoch": 0.8496942388155777,
"grad_norm": 123.08939858015702,
"learning_rate": 7.876690276883451e-07,
"logits/chosen": -0.4756835997104645,
"logits/rejected": -0.5056854486465454,
"logps/chosen": -392.625,
"logps/rejected": -380.5249938964844,
"loss": 0.6656,
"rewards/accuracies": 0.668749988079071,
"rewards/chosen": -0.29423826932907104,
"rewards/margins": 0.930346667766571,
"rewards/rejected": -1.225061058998108,
"step": 1320
},
{
"epoch": 0.8561313163823624,
"grad_norm": 89.38220487310218,
"learning_rate": 7.860592401802961e-07,
"logits/chosen": -0.5153290033340454,
"logits/rejected": -0.5448852777481079,
"logps/chosen": -406.92498779296875,
"logps/rejected": -377.625,
"loss": 0.6152,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.2519470155239105,
"rewards/margins": 0.8592529296875,
"rewards/rejected": -1.1110961437225342,
"step": 1330
},
{
"epoch": 0.8625683939491471,
"grad_norm": 138.69932522724545,
"learning_rate": 7.844494526722473e-07,
"logits/chosen": -0.43743896484375,
"logits/rejected": -0.45673829317092896,
"logps/chosen": -381.0375061035156,
"logps/rejected": -372.75,
"loss": 0.6838,
"rewards/accuracies": 0.612500011920929,
"rewards/chosen": -0.09254150092601776,
"rewards/margins": 0.789379894733429,
"rewards/rejected": -0.882275402545929,
"step": 1340
},
{
"epoch": 0.8690054715159318,
"grad_norm": 101.36114737984545,
"learning_rate": 7.828396651641983e-07,
"logits/chosen": -0.5053650140762329,
"logits/rejected": -0.511737048625946,
"logps/chosen": -386.0874938964844,
"logps/rejected": -340.79376220703125,
"loss": 0.6082,
"rewards/accuracies": 0.637499988079071,
"rewards/chosen": 0.2793136537075043,
"rewards/margins": 1.0363891124725342,
"rewards/rejected": -0.7570556402206421,
"step": 1350
},
{
"epoch": 0.8754425490827165,
"grad_norm": 56.94113918190888,
"learning_rate": 7.812298776561493e-07,
"logits/chosen": -0.45692139863967896,
"logits/rejected": -0.47791749238967896,
"logps/chosen": -400.7250061035156,
"logps/rejected": -383.375,
"loss": 0.5721,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.06065673753619194,
"rewards/margins": 1.01776123046875,
"rewards/rejected": -0.9569336175918579,
"step": 1360
},
{
"epoch": 0.8818796266495011,
"grad_norm": 87.21788738477099,
"learning_rate": 7.796200901481004e-07,
"logits/chosen": -0.43765562772750854,
"logits/rejected": -0.4749755859375,
"logps/chosen": -340.1000061035156,
"logps/rejected": -339.7250061035156,
"loss": 0.7079,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.2620178163051605,
"rewards/margins": 0.7551513910293579,
"rewards/rejected": -1.0172851085662842,
"step": 1370
},
{
"epoch": 0.8883167042162858,
"grad_norm": 116.26399959827697,
"learning_rate": 7.780103026400516e-07,
"logits/chosen": -0.457510381937027,
"logits/rejected": -0.48211669921875,
"logps/chosen": -376.32501220703125,
"logps/rejected": -366.95001220703125,
"loss": 0.7661,
"rewards/accuracies": 0.581250011920929,
"rewards/chosen": -0.46033018827438354,
"rewards/margins": 0.6608642339706421,
"rewards/rejected": -1.121118187904358,
"step": 1380
},
{
"epoch": 0.8947537817830705,
"grad_norm": 70.21186430940142,
"learning_rate": 7.764005151320025e-07,
"logits/chosen": -0.47960203886032104,
"logits/rejected": -0.517138659954071,
"logps/chosen": -344.79998779296875,
"logps/rejected": -343.3999938964844,
"loss": 0.4856,
"rewards/accuracies": 0.7124999761581421,
"rewards/chosen": -0.19971923530101776,
"rewards/margins": 1.256591796875,
"rewards/rejected": -1.4572632312774658,
"step": 1390
},
{
"epoch": 0.9011908593498552,
"grad_norm": 112.5823484060804,
"learning_rate": 7.747907276239536e-07,
"logits/chosen": -0.500781238079071,
"logits/rejected": -0.5128418207168579,
"logps/chosen": -392.375,
"logps/rejected": -373.1000061035156,
"loss": 0.5976,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.542877197265625,
"rewards/margins": 1.1980102062225342,
"rewards/rejected": -1.740942358970642,
"step": 1400
},
{
"epoch": 0.9076279369166399,
"grad_norm": 108.00708309053341,
"learning_rate": 7.731809401159047e-07,
"logits/chosen": -0.44998472929000854,
"logits/rejected": -0.4686279296875,
"logps/chosen": -384.8374938964844,
"logps/rejected": -384.95001220703125,
"loss": 0.5577,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.6136230230331421,
"rewards/margins": 1.4021484851837158,
"rewards/rejected": -2.0157883167266846,
"step": 1410
},
{
"epoch": 0.9140650144834245,
"grad_norm": 75.63651943592622,
"learning_rate": 7.715711526078557e-07,
"logits/chosen": -0.4461120665073395,
"logits/rejected": -0.46266478300094604,
"logps/chosen": -357.75,
"logps/rejected": -340.36248779296875,
"loss": 0.6517,
"rewards/accuracies": 0.6812499761581421,
"rewards/chosen": -0.07795409858226776,
"rewards/margins": 1.0103881359100342,
"rewards/rejected": -1.087805151939392,
"step": 1420
},
{
"epoch": 0.9205020920502092,
"grad_norm": 82.65401725045969,
"learning_rate": 7.699613650998068e-07,
"logits/chosen": -0.4739746153354645,
"logits/rejected": -0.5115722417831421,
"logps/chosen": -378.875,
"logps/rejected": -375.20001220703125,
"loss": 0.6256,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": 0.321298211812973,
"rewards/margins": 0.9541260004043579,
"rewards/rejected": -0.6323302984237671,
"step": 1430
},
{
"epoch": 0.9269391696169939,
"grad_norm": 112.68383111556054,
"learning_rate": 7.683515775917579e-07,
"logits/chosen": -0.5020507574081421,
"logits/rejected": -0.510693371295929,
"logps/chosen": -360.61248779296875,
"logps/rejected": -361.67498779296875,
"loss": 0.6268,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.434814453125,
"rewards/margins": 0.9604736566543579,
"rewards/rejected": -0.5249465703964233,
"step": 1440
},
{
"epoch": 0.9333762471837785,
"grad_norm": 121.03410484944297,
"learning_rate": 7.667417900837089e-07,
"logits/chosen": -0.44097900390625,
"logits/rejected": -0.45458984375,
"logps/chosen": -374.5625,
"logps/rejected": -340.5249938964844,
"loss": 0.6559,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": 0.13691405951976776,
"rewards/margins": 1.165869116783142,
"rewards/rejected": -1.029052734375,
"step": 1450
},
{
"epoch": 0.9398133247505632,
"grad_norm": 99.05584268644827,
"learning_rate": 7.6513200257566e-07,
"logits/chosen": -0.5095580816268921,
"logits/rejected": -0.5365966558456421,
"logps/chosen": -380.42498779296875,
"logps/rejected": -349.1499938964844,
"loss": 0.59,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.10870361328125,
"rewards/margins": 1.219384789466858,
"rewards/rejected": -1.110510230064392,
"step": 1460
},
{
"epoch": 0.9462504023173479,
"grad_norm": 130.78950082280264,
"learning_rate": 7.63522215067611e-07,
"logits/chosen": -0.45726317167282104,
"logits/rejected": -0.4390853941440582,
"logps/chosen": -384.7124938964844,
"logps/rejected": -380.2749938964844,
"loss": 0.7047,
"rewards/accuracies": 0.6625000238418579,
"rewards/chosen": -0.13157348334789276,
"rewards/margins": 0.8795715570449829,
"rewards/rejected": -1.01123046875,
"step": 1470
},
{
"epoch": 0.9526874798841326,
"grad_norm": 100.85870827827803,
"learning_rate": 7.619124275595621e-07,
"logits/chosen": -0.4605956971645355,
"logits/rejected": -0.5074218511581421,
"logps/chosen": -406.5249938964844,
"logps/rejected": -398.3500061035156,
"loss": 0.5323,
"rewards/accuracies": 0.6937500238418579,
"rewards/chosen": 0.14664916694164276,
"rewards/margins": 1.08514404296875,
"rewards/rejected": -0.939013659954071,
"step": 1480
},
{
"epoch": 0.9591245574509173,
"grad_norm": 99.51512777249033,
"learning_rate": 7.603026400515131e-07,
"logits/chosen": -0.519457995891571,
"logits/rejected": -0.5551391839981079,
"logps/chosen": -412.1499938964844,
"logps/rejected": -398.42498779296875,
"loss": 0.5587,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.12549439072608948,
"rewards/margins": 1.107519507408142,
"rewards/rejected": -1.232666015625,
"step": 1490
},
{
"epoch": 0.965561635017702,
"grad_norm": 118.0541567845769,
"learning_rate": 7.586928525434642e-07,
"logits/chosen": -0.43101805448532104,
"logits/rejected": -0.40216064453125,
"logps/chosen": -390.5249938964844,
"logps/rejected": -370.0,
"loss": 0.6822,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.705487072467804,
"rewards/margins": 1.0155029296875,
"rewards/rejected": -1.7212402820587158,
"step": 1500
},
{
"epoch": 0.9719987125844867,
"grad_norm": 98.22598118527986,
"learning_rate": 7.570830650354153e-07,
"logits/chosen": -0.46629029512405396,
"logits/rejected": -0.47856444120407104,
"logps/chosen": -374.36248779296875,
"logps/rejected": -351.8999938964844,
"loss": 0.5244,
"rewards/accuracies": 0.7562500238418579,
"rewards/chosen": -0.17139282822608948,
"rewards/margins": 1.374121069908142,
"rewards/rejected": -1.545922875404358,
"step": 1510
},
{
"epoch": 0.9784357901512714,
"grad_norm": 117.92656420297726,
"learning_rate": 7.554732775273664e-07,
"logits/chosen": -0.486328125,
"logits/rejected": -0.4902099668979645,
"logps/chosen": -353.3500061035156,
"logps/rejected": -372.4750061035156,
"loss": 0.6914,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.07288818061351776,
"rewards/margins": 0.8248291015625,
"rewards/rejected": -0.752392590045929,
"step": 1520
},
{
"epoch": 0.984872867718056,
"grad_norm": 103.7352972935465,
"learning_rate": 7.538634900193173e-07,
"logits/chosen": -0.44585877656936646,
"logits/rejected": -0.4797119200229645,
"logps/chosen": -364.51251220703125,
"logps/rejected": -334.07501220703125,
"loss": 0.5836,
"rewards/accuracies": 0.706250011920929,
"rewards/chosen": 0.17331238090991974,
"rewards/margins": 1.103173851966858,
"rewards/rejected": -0.929003894329071,
"step": 1530
},
{
"epoch": 0.9913099452848407,
"grad_norm": 92.0120508509047,
"learning_rate": 7.522537025112685e-07,
"logits/chosen": -0.432577520608902,
"logits/rejected": -0.44459229707717896,
"logps/chosen": -374.3999938964844,
"logps/rejected": -374.625,
"loss": 0.5247,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.04023437574505806,
"rewards/margins": 1.244116187095642,
"rewards/rejected": -1.2042725086212158,
"step": 1540
},
{
"epoch": 0.9977470228516253,
"grad_norm": 113.60262425936246,
"learning_rate": 7.506439150032196e-07,
"logits/chosen": -0.44282227754592896,
"logits/rejected": -0.4719482362270355,
"logps/chosen": -399.1499938964844,
"logps/rejected": -388.2749938964844,
"loss": 0.5858,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": -0.48509520292282104,
"rewards/margins": 1.2941710948944092,
"rewards/rejected": -1.7789428234100342,
"step": 1550
},
{
"epoch": 1.0038622465400708,
"grad_norm": 28.701645450043788,
"learning_rate": 7.490341274951706e-07,
"logits/chosen": -0.5120528340339661,
"logits/rejected": -0.5163445472717285,
"logps/chosen": -368.6842041015625,
"logps/rejected": -373.47369384765625,
"loss": 0.2804,
"rewards/accuracies": 0.8223684430122375,
"rewards/chosen": 0.9294819235801697,
"rewards/margins": 4.5301833152771,
"rewards/rejected": -3.5959086418151855,
"step": 1560
},
{
"epoch": 1.0102993241068554,
"grad_norm": 60.32074871596137,
"learning_rate": 7.474243399871216e-07,
"logits/chosen": -0.4825439453125,
"logits/rejected": -0.52020263671875,
"logps/chosen": -371.92498779296875,
"logps/rejected": -425.45001220703125,
"loss": 0.0487,
"rewards/accuracies": 0.96875,
"rewards/chosen": 2.0789122581481934,
"rewards/margins": 7.958593845367432,
"rewards/rejected": -5.882421970367432,
"step": 1570
},
{
"epoch": 1.0167364016736402,
"grad_norm": 71.52396938669607,
"learning_rate": 7.458145524790728e-07,
"logits/chosen": -0.6259857416152954,
"logits/rejected": -0.646166980266571,
"logps/chosen": -352.3999938964844,
"logps/rejected": -411.70001220703125,
"loss": 0.0354,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": 1.0871460437774658,
"rewards/margins": 8.010156631469727,
"rewards/rejected": -6.9296875,
"step": 1580
},
{
"epoch": 1.0231734792404248,
"grad_norm": 9.724575140553721,
"learning_rate": 7.442047649710238e-07,
"logits/chosen": -0.687255859375,
"logits/rejected": -0.711743175983429,
"logps/chosen": -335.79998779296875,
"logps/rejected": -400.25,
"loss": 0.052,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.412109375,
"rewards/margins": 8.798828125,
"rewards/rejected": -9.207422256469727,
"step": 1590
},
{
"epoch": 1.0296105568072096,
"grad_norm": 42.3472252623567,
"learning_rate": 7.425949774629749e-07,
"logits/chosen": -0.783618152141571,
"logits/rejected": -0.7865371704101562,
"logps/chosen": -406.625,
"logps/rejected": -462.3999938964844,
"loss": 0.0677,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.48292237520217896,
"rewards/margins": 10.419140815734863,
"rewards/rejected": -10.904687881469727,
"step": 1600
},
{
"epoch": 1.0360476343739942,
"grad_norm": 44.590992711597345,
"learning_rate": 7.409851899549258e-07,
"logits/chosen": -0.7693115472793579,
"logits/rejected": -0.7798522710800171,
"logps/chosen": -367.6499938964844,
"logps/rejected": -441.5625,
"loss": 0.0596,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.7735351324081421,
"rewards/margins": 9.705469131469727,
"rewards/rejected": -10.483593940734863,
"step": 1610
},
{
"epoch": 1.042484711940779,
"grad_norm": 12.122547274948735,
"learning_rate": 7.39375402446877e-07,
"logits/chosen": -0.7435302734375,
"logits/rejected": -0.745318591594696,
"logps/chosen": -353.125,
"logps/rejected": -426.17498779296875,
"loss": 0.0561,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.11784668266773224,
"rewards/margins": 9.178125381469727,
"rewards/rejected": -9.298437118530273,
"step": 1620
},
{
"epoch": 1.0489217895075635,
"grad_norm": 4.7060888899695135,
"learning_rate": 7.377656149388281e-07,
"logits/chosen": -0.799609363079071,
"logits/rejected": -0.780871570110321,
"logps/chosen": -393.625,
"logps/rejected": -469.5249938964844,
"loss": 0.0357,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.3866333067417145,
"rewards/margins": 9.78515625,
"rewards/rejected": -10.168749809265137,
"step": 1630
},
{
"epoch": 1.0553588670743483,
"grad_norm": 19.42538895152891,
"learning_rate": 7.36155827430779e-07,
"logits/chosen": -0.8111816644668579,
"logits/rejected": -0.814648449420929,
"logps/chosen": -377.04998779296875,
"logps/rejected": -452.11248779296875,
"loss": 0.0331,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.6400299072265625,
"rewards/margins": 9.115625381469727,
"rewards/rejected": -9.759374618530273,
"step": 1640
},
{
"epoch": 1.061795944641133,
"grad_norm": 1.1011234013173983,
"learning_rate": 7.345460399227301e-07,
"logits/chosen": -0.773486316204071,
"logits/rejected": -0.772021472454071,
"logps/chosen": -405.7749938964844,
"logps/rejected": -478.2749938964844,
"loss": 0.0311,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.60272216796875,
"rewards/margins": 10.611719131469727,
"rewards/rejected": -11.21875,
"step": 1650
},
{
"epoch": 1.0682330222079175,
"grad_norm": 26.178562770306236,
"learning_rate": 7.329362524146813e-07,
"logits/chosen": -0.712841808795929,
"logits/rejected": -0.7065674066543579,
"logps/chosen": -353.73748779296875,
"logps/rejected": -436.2749938964844,
"loss": 0.0538,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.7074829339981079,
"rewards/margins": 8.717187881469727,
"rewards/rejected": -9.428906440734863,
"step": 1660
},
{
"epoch": 1.0746700997747023,
"grad_norm": 1.209371501717102,
"learning_rate": 7.313264649066323e-07,
"logits/chosen": -0.7484130859375,
"logits/rejected": -0.774340808391571,
"logps/chosen": -378.5625,
"logps/rejected": -436.29998779296875,
"loss": 0.0313,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": 0.3489746153354645,
"rewards/margins": 8.931640625,
"rewards/rejected": -8.578906059265137,
"step": 1670
},
{
"epoch": 1.0811071773414869,
"grad_norm": 5.4457811328971815,
"learning_rate": 7.297166773985833e-07,
"logits/chosen": -0.726611316204071,
"logits/rejected": -0.738110363483429,
"logps/chosen": -353.79998779296875,
"logps/rejected": -463.6499938964844,
"loss": 0.0396,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.09562988579273224,
"rewards/margins": 10.096094131469727,
"rewards/rejected": -10.197656631469727,
"step": 1680
},
{
"epoch": 1.0875442549082717,
"grad_norm": 78.32697539506492,
"learning_rate": 7.281068898905344e-07,
"logits/chosen": -0.871044933795929,
"logits/rejected": -0.8653320074081421,
"logps/chosen": -401.8500061035156,
"logps/rejected": -505.54998779296875,
"loss": 0.0434,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.7566101551055908,
"rewards/margins": 10.932031631469727,
"rewards/rejected": -12.690625190734863,
"step": 1690
},
{
"epoch": 1.0939813324750562,
"grad_norm": 30.05286319924308,
"learning_rate": 7.264971023824855e-07,
"logits/chosen": -0.869873046875,
"logits/rejected": -0.87158203125,
"logps/chosen": -365.3374938964844,
"logps/rejected": -441.5,
"loss": 0.0598,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.2253174781799316,
"rewards/margins": 10.394922256469727,
"rewards/rejected": -12.62890625,
"step": 1700
},
{
"epoch": 1.100418410041841,
"grad_norm": 14.131277242386574,
"learning_rate": 7.248873148744366e-07,
"logits/chosen": -0.841992199420929,
"logits/rejected": -0.883532702922821,
"logps/chosen": -409.67498779296875,
"logps/rejected": -448.1000061035156,
"loss": 0.0498,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.0384764671325684,
"rewards/margins": 9.805468559265137,
"rewards/rejected": -11.846094131469727,
"step": 1710
},
{
"epoch": 1.1068554876086256,
"grad_norm": 7.132116530747616,
"learning_rate": 7.232775273663876e-07,
"logits/chosen": -0.8307861089706421,
"logits/rejected": -0.877148449420929,
"logps/chosen": -413.26251220703125,
"logps/rejected": -495.6499938964844,
"loss": 0.0771,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -0.5871948003768921,
"rewards/margins": 11.547656059265137,
"rewards/rejected": -12.12109375,
"step": 1720
},
{
"epoch": 1.1132925651754104,
"grad_norm": 0.47230522302878464,
"learning_rate": 7.216677398583386e-07,
"logits/chosen": -0.8125,
"logits/rejected": -0.8301757574081421,
"logps/chosen": -352.57501220703125,
"logps/rejected": -443.875,
"loss": 0.0518,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.527294933795929,
"rewards/margins": 10.287500381469727,
"rewards/rejected": -10.814844131469727,
"step": 1730
},
{
"epoch": 1.119729642742195,
"grad_norm": 37.48581782587474,
"learning_rate": 7.200579523502898e-07,
"logits/chosen": -0.687573254108429,
"logits/rejected": -0.688122570514679,
"logps/chosen": -382.375,
"logps/rejected": -495.54998779296875,
"loss": 0.0648,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.15927734971046448,
"rewards/margins": 11.528905868530273,
"rewards/rejected": -11.6953125,
"step": 1740
},
{
"epoch": 1.1261667203089798,
"grad_norm": 41.26402499082609,
"learning_rate": 7.184481648422408e-07,
"logits/chosen": -0.878955066204071,
"logits/rejected": -0.896044909954071,
"logps/chosen": -364.6000061035156,
"logps/rejected": -447.7250061035156,
"loss": 0.0548,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.19716796278953552,
"rewards/margins": 10.053515434265137,
"rewards/rejected": -10.253125190734863,
"step": 1750
},
{
"epoch": 1.1326037978757644,
"grad_norm": 3.6822102341100567,
"learning_rate": 7.168383773341918e-07,
"logits/chosen": -0.8634277582168579,
"logits/rejected": -0.873974621295929,
"logps/chosen": -392.20001220703125,
"logps/rejected": -458.20001220703125,
"loss": 0.0257,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -0.2974609434604645,
"rewards/margins": 10.384374618530273,
"rewards/rejected": -10.675000190734863,
"step": 1760
},
{
"epoch": 1.1390408754425492,
"grad_norm": 4.0760843716589426,
"learning_rate": 7.152285898261429e-07,
"logits/chosen": -0.8376098871231079,
"logits/rejected": -0.8130859136581421,
"logps/chosen": -376.8999938964844,
"logps/rejected": -478.8999938964844,
"loss": 0.0287,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.418371558189392,
"rewards/margins": 11.157031059265137,
"rewards/rejected": -12.575780868530273,
"step": 1770
},
{
"epoch": 1.1454779530093337,
"grad_norm": 17.081009996286852,
"learning_rate": 7.136188023180941e-07,
"logits/chosen": -0.81988525390625,
"logits/rejected": -0.8177734613418579,
"logps/chosen": -406.5,
"logps/rejected": -492.4750061035156,
"loss": 0.0404,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.221630811691284,
"rewards/margins": 11.858593940734863,
"rewards/rejected": -14.083593368530273,
"step": 1780
},
{
"epoch": 1.1519150305761183,
"grad_norm": 16.670165572478858,
"learning_rate": 7.12009014810045e-07,
"logits/chosen": -0.878173828125,
"logits/rejected": -0.886474609375,
"logps/chosen": -406.82501220703125,
"logps/rejected": -475.7250061035156,
"loss": 0.0203,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.0299072265625,
"rewards/margins": 11.866796493530273,
"rewards/rejected": -13.893750190734863,
"step": 1790
},
{
"epoch": 1.1583521081429031,
"grad_norm": 14.789491416020818,
"learning_rate": 7.103992273019961e-07,
"logits/chosen": -0.789306640625,
"logits/rejected": -0.776171863079071,
"logps/chosen": -414.42498779296875,
"logps/rejected": -475.95001220703125,
"loss": 0.034,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.1190063953399658,
"rewards/margins": 10.380859375,
"rewards/rejected": -11.503125190734863,
"step": 1800
},
{
"epoch": 1.164789185709688,
"grad_norm": 13.586311507009619,
"learning_rate": 7.087894397939471e-07,
"logits/chosen": -0.8396972417831421,
"logits/rejected": -0.8243652582168579,
"logps/chosen": -399.6499938964844,
"logps/rejected": -458.79998779296875,
"loss": 0.0374,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.6400878429412842,
"rewards/margins": 10.001562118530273,
"rewards/rejected": -11.642187118530273,
"step": 1810
},
{
"epoch": 1.1712262632764725,
"grad_norm": 55.57830649329583,
"learning_rate": 7.071796522858983e-07,
"logits/chosen": -0.861035168170929,
"logits/rejected": -0.846386730670929,
"logps/chosen": -402.2250061035156,
"logps/rejected": -496.1000061035156,
"loss": 0.0441,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.8700439929962158,
"rewards/margins": 11.387499809265137,
"rewards/rejected": -13.250781059265137,
"step": 1820
},
{
"epoch": 1.177663340843257,
"grad_norm": 18.828474480482623,
"learning_rate": 7.055698647778493e-07,
"logits/chosen": -0.851696789264679,
"logits/rejected": -0.8456054925918579,
"logps/chosen": -372.8999938964844,
"logps/rejected": -439.6000061035156,
"loss": 0.066,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -3.3226075172424316,
"rewards/margins": 10.33984375,
"rewards/rejected": -13.662500381469727,
"step": 1830
},
{
"epoch": 1.1841004184100419,
"grad_norm": 0.9764059185254257,
"learning_rate": 7.039600772698003e-07,
"logits/chosen": -0.82470703125,
"logits/rejected": -0.806689441204071,
"logps/chosen": -388.01251220703125,
"logps/rejected": -486.29998779296875,
"loss": 0.0703,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.5329222679138184,
"rewards/margins": 10.471094131469727,
"rewards/rejected": -13.009374618530273,
"step": 1840
},
{
"epoch": 1.1905374959768265,
"grad_norm": 3.7355014099628647,
"learning_rate": 7.023502897617514e-07,
"logits/chosen": -0.7955566644668579,
"logits/rejected": -0.8161865472793579,
"logps/chosen": -420.95001220703125,
"logps/rejected": -477.20001220703125,
"loss": 0.0414,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.4476196765899658,
"rewards/margins": 10.553515434265137,
"rewards/rejected": -12.003125190734863,
"step": 1850
},
{
"epoch": 1.1969745735436113,
"grad_norm": 23.271976132825916,
"learning_rate": 7.007405022537025e-07,
"logits/chosen": -0.7967590093612671,
"logits/rejected": -0.8336181640625,
"logps/chosen": -372.2749938964844,
"logps/rejected": -485.0249938964844,
"loss": 0.0653,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -3.135058641433716,
"rewards/margins": 11.382031440734863,
"rewards/rejected": -14.517969131469727,
"step": 1860
},
{
"epoch": 1.2034116511103958,
"grad_norm": 65.18811151029988,
"learning_rate": 6.991307147456535e-07,
"logits/chosen": -0.8287597894668579,
"logits/rejected": -0.823779284954071,
"logps/chosen": -387.79998779296875,
"logps/rejected": -462.4750061035156,
"loss": 0.035,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.011474609375,
"rewards/margins": 11.100781440734863,
"rewards/rejected": -13.106249809265137,
"step": 1870
},
{
"epoch": 1.2098487286771806,
"grad_norm": 10.973771958166278,
"learning_rate": 6.975209272376046e-07,
"logits/chosen": -0.7869873046875,
"logits/rejected": -0.7986816167831421,
"logps/chosen": -360.5249938964844,
"logps/rejected": -439.20001220703125,
"loss": 0.038,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.812768578529358,
"rewards/margins": 10.350781440734863,
"rewards/rejected": -12.167187690734863,
"step": 1880
},
{
"epoch": 1.2162858062439652,
"grad_norm": 0.1795200411379023,
"learning_rate": 6.959111397295557e-07,
"logits/chosen": -0.8089843988418579,
"logits/rejected": -0.7916015386581421,
"logps/chosen": -327.3500061035156,
"logps/rejected": -447.54998779296875,
"loss": 0.0326,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.839111328125,
"rewards/margins": 10.127344131469727,
"rewards/rejected": -10.97265625,
"step": 1890
},
{
"epoch": 1.22272288381075,
"grad_norm": 6.31069489977895,
"learning_rate": 6.943013522215067e-07,
"logits/chosen": -0.7904297113418579,
"logits/rejected": -0.789257824420929,
"logps/chosen": -380.79998779296875,
"logps/rejected": -457.5,
"loss": 0.0564,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": 0.0034423829056322575,
"rewards/margins": 10.767187118530273,
"rewards/rejected": -10.768750190734863,
"step": 1900
},
{
"epoch": 1.2291599613775346,
"grad_norm": 1.890302975072155,
"learning_rate": 6.926915647134578e-07,
"logits/chosen": -0.8453521728515625,
"logits/rejected": -0.8412109613418579,
"logps/chosen": -400.70001220703125,
"logps/rejected": -479.8500061035156,
"loss": 0.0241,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.521453857421875,
"rewards/margins": 10.838281631469727,
"rewards/rejected": -11.364062309265137,
"step": 1910
},
{
"epoch": 1.2355970389443192,
"grad_norm": 5.2209876862192015,
"learning_rate": 6.910817772054089e-07,
"logits/chosen": -0.8232421875,
"logits/rejected": -0.831591784954071,
"logps/chosen": -363.8500061035156,
"logps/rejected": -451.125,
"loss": 0.0463,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.1357421875,
"rewards/margins": 10.284375190734863,
"rewards/rejected": -11.41796875,
"step": 1920
},
{
"epoch": 1.242034116511104,
"grad_norm": 8.784840887843162,
"learning_rate": 6.894719896973599e-07,
"logits/chosen": -0.854248046875,
"logits/rejected": -0.857421875,
"logps/chosen": -385.2250061035156,
"logps/rejected": -471.3999938964844,
"loss": 0.0269,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.4132934510707855,
"rewards/margins": 10.916406631469727,
"rewards/rejected": -11.321093559265137,
"step": 1930
},
{
"epoch": 1.2484711940778888,
"grad_norm": 11.499308969293939,
"learning_rate": 6.87862202189311e-07,
"logits/chosen": -0.8663085699081421,
"logits/rejected": -0.8819824457168579,
"logps/chosen": -367.20001220703125,
"logps/rejected": -482.4750061035156,
"loss": 0.0393,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.7445312738418579,
"rewards/margins": 10.687891006469727,
"rewards/rejected": -11.436718940734863,
"step": 1940
},
{
"epoch": 1.2549082716446733,
"grad_norm": 5.476246704655694,
"learning_rate": 6.86252414681262e-07,
"logits/chosen": -0.785839855670929,
"logits/rejected": -0.802783191204071,
"logps/chosen": -393.25,
"logps/rejected": -481.1499938964844,
"loss": 0.07,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -1.304406762123108,
"rewards/margins": 10.49609375,
"rewards/rejected": -11.80078125,
"step": 1950
},
{
"epoch": 1.261345349211458,
"grad_norm": 1.8068433654986311,
"learning_rate": 6.846426271732131e-07,
"logits/chosen": -0.8782958984375,
"logits/rejected": -0.878369152545929,
"logps/chosen": -366.95001220703125,
"logps/rejected": -481.4750061035156,
"loss": 0.0281,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.360253930091858,
"rewards/margins": 11.563281059265137,
"rewards/rejected": -12.9296875,
"step": 1960
},
{
"epoch": 1.2677824267782427,
"grad_norm": 1.5992649831411958,
"learning_rate": 6.830328396651641e-07,
"logits/chosen": -0.916015625,
"logits/rejected": -0.910888671875,
"logps/chosen": -351.2749938964844,
"logps/rejected": -440.92498779296875,
"loss": 0.0428,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.484375,
"rewards/margins": 10.620312690734863,
"rewards/rejected": -12.095312118530273,
"step": 1970
},
{
"epoch": 1.2742195043450273,
"grad_norm": 11.932348554376217,
"learning_rate": 6.814230521571152e-07,
"logits/chosen": -0.7955566644668579,
"logits/rejected": -0.812182605266571,
"logps/chosen": -405.0249938964844,
"logps/rejected": -501.5,
"loss": 0.0258,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.031854271888733,
"rewards/margins": 11.592187881469727,
"rewards/rejected": -12.624218940734863,
"step": 1980
},
{
"epoch": 1.280656581911812,
"grad_norm": 0.7284651571104193,
"learning_rate": 6.798132646490663e-07,
"logits/chosen": -0.687243640422821,
"logits/rejected": -0.7085205316543579,
"logps/chosen": -370.9125061035156,
"logps/rejected": -477.25,
"loss": 0.0594,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.3655884265899658,
"rewards/margins": 11.599218368530273,
"rewards/rejected": -12.961718559265137,
"step": 1990
},
{
"epoch": 1.2870936594785967,
"grad_norm": 0.1726195121834098,
"learning_rate": 6.782034771410174e-07,
"logits/chosen": -0.886474609375,
"logits/rejected": -0.9327148199081421,
"logps/chosen": -374.79998779296875,
"logps/rejected": -464.75,
"loss": 0.0157,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -1.9635009765625,
"rewards/margins": 10.838281631469727,
"rewards/rejected": -12.809374809265137,
"step": 2000
},
{
"epoch": 1.2935307370453815,
"grad_norm": 4.855214989312065,
"learning_rate": 6.765936896329683e-07,
"logits/chosen": -0.7554687261581421,
"logits/rejected": -0.762524425983429,
"logps/chosen": -353.7749938964844,
"logps/rejected": -453.79998779296875,
"loss": 0.0237,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.166912794113159,
"rewards/margins": 10.567187309265137,
"rewards/rejected": -12.739062309265137,
"step": 2010
},
{
"epoch": 1.299967814612166,
"grad_norm": 3.805160643591438,
"learning_rate": 6.749839021249195e-07,
"logits/chosen": -0.774462878704071,
"logits/rejected": -0.8001464605331421,
"logps/chosen": -431.25,
"logps/rejected": -509.375,
"loss": 0.0564,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.2074341773986816,
"rewards/margins": 11.928125381469727,
"rewards/rejected": -14.134374618530273,
"step": 2020
},
{
"epoch": 1.3064048921789508,
"grad_norm": 12.782556298742978,
"learning_rate": 6.733741146168706e-07,
"logits/chosen": -0.6968749761581421,
"logits/rejected": -0.719860851764679,
"logps/chosen": -363.04998779296875,
"logps/rejected": -473.6499938964844,
"loss": 0.03,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.2151978015899658,
"rewards/margins": 12.274218559265137,
"rewards/rejected": -13.489062309265137,
"step": 2030
},
{
"epoch": 1.3128419697457354,
"grad_norm": 90.75357097442223,
"learning_rate": 6.717643271088216e-07,
"logits/chosen": -0.7369629144668579,
"logits/rejected": -0.760327160358429,
"logps/chosen": -395.13751220703125,
"logps/rejected": -462.79998779296875,
"loss": 0.0882,
"rewards/accuracies": 0.9375,
"rewards/chosen": -2.4952149391174316,
"rewards/margins": 10.8828125,
"rewards/rejected": -13.3671875,
"step": 2040
},
{
"epoch": 1.31927904731252,
"grad_norm": 0.5115947981333193,
"learning_rate": 6.701545396007726e-07,
"logits/chosen": -0.807690441608429,
"logits/rejected": -0.8475097417831421,
"logps/chosen": -365.8999938964844,
"logps/rejected": -443.20001220703125,
"loss": 0.0529,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.2901368141174316,
"rewards/margins": 10.971875190734863,
"rewards/rejected": -13.258593559265137,
"step": 2050
},
{
"epoch": 1.3257161248793048,
"grad_norm": 0.18940957690475052,
"learning_rate": 6.685447520927238e-07,
"logits/chosen": -0.775683581829071,
"logits/rejected": -0.818310558795929,
"logps/chosen": -360.25,
"logps/rejected": -440.8999938964844,
"loss": 0.0328,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.39141845703125,
"rewards/margins": 10.676562309265137,
"rewards/rejected": -12.060155868530273,
"step": 2060
},
{
"epoch": 1.3321532024460896,
"grad_norm": 6.818009967898228,
"learning_rate": 6.669349645846748e-07,
"logits/chosen": -0.794970691204071,
"logits/rejected": -0.8131347894668579,
"logps/chosen": -396.70001220703125,
"logps/rejected": -451.1499938964844,
"loss": 0.036,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.8651977777481079,
"rewards/margins": 10.630468368530273,
"rewards/rejected": -11.493749618530273,
"step": 2070
},
{
"epoch": 1.3385902800128742,
"grad_norm": 20.477227570556575,
"learning_rate": 6.653251770766258e-07,
"logits/chosen": -0.772412121295929,
"logits/rejected": -0.787646472454071,
"logps/chosen": -381.73748779296875,
"logps/rejected": -452.6499938964844,
"loss": 0.046,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.25780028104782104,
"rewards/margins": 10.538281440734863,
"rewards/rejected": -10.794530868530273,
"step": 2080
},
{
"epoch": 1.3450273575796587,
"grad_norm": 1.8958489445333633,
"learning_rate": 6.637153895685768e-07,
"logits/chosen": -0.758129894733429,
"logits/rejected": -0.7566162347793579,
"logps/chosen": -376.875,
"logps/rejected": -473.07501220703125,
"loss": 0.0434,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.41459959745407104,
"rewards/margins": 10.59375,
"rewards/rejected": -11.004687309265137,
"step": 2090
},
{
"epoch": 1.3514644351464435,
"grad_norm": 15.797070454042899,
"learning_rate": 6.62105602060528e-07,
"logits/chosen": -0.7794433832168579,
"logits/rejected": -0.765332043170929,
"logps/chosen": -375.7749938964844,
"logps/rejected": -448.20001220703125,
"loss": 0.0274,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.5860840082168579,
"rewards/margins": 10.074609756469727,
"rewards/rejected": -10.665234565734863,
"step": 2100
},
{
"epoch": 1.3579015127132281,
"grad_norm": 17.274563010286307,
"learning_rate": 6.604958145524791e-07,
"logits/chosen": -0.7362338900566101,
"logits/rejected": -0.7653137445449829,
"logps/chosen": -395.25,
"logps/rejected": -454.4750061035156,
"loss": 0.0504,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.1345703601837158,
"rewards/margins": 9.571093559265137,
"rewards/rejected": -10.703906059265137,
"step": 2110
},
{
"epoch": 1.364338590280013,
"grad_norm": 34.1120810421438,
"learning_rate": 6.5888602704443e-07,
"logits/chosen": -0.7216430902481079,
"logits/rejected": -0.7294555902481079,
"logps/chosen": -366.0375061035156,
"logps/rejected": -448.3999938964844,
"loss": 0.04,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 0.01531982421875,
"rewards/margins": 10.12109375,
"rewards/rejected": -10.103906631469727,
"step": 2120
},
{
"epoch": 1.3707756678467975,
"grad_norm": 35.51436144182908,
"learning_rate": 6.572762395363811e-07,
"logits/chosen": -0.7086426019668579,
"logits/rejected": -0.7312988042831421,
"logps/chosen": -378.67498779296875,
"logps/rejected": -473.5375061035156,
"loss": 0.0406,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3042968809604645,
"rewards/margins": 10.831250190734863,
"rewards/rejected": -10.525781631469727,
"step": 2130
},
{
"epoch": 1.3772127454135823,
"grad_norm": 7.163516950663505,
"learning_rate": 6.556664520283323e-07,
"logits/chosen": -0.7219482660293579,
"logits/rejected": -0.7713867425918579,
"logps/chosen": -375.95001220703125,
"logps/rejected": -441.20001220703125,
"loss": 0.0507,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -0.01722412183880806,
"rewards/margins": 10.337499618530273,
"rewards/rejected": -10.358593940734863,
"step": 2140
},
{
"epoch": 1.3836498229803669,
"grad_norm": 5.920479235836306,
"learning_rate": 6.540566645202833e-07,
"logits/chosen": -0.726318359375,
"logits/rejected": -0.734570324420929,
"logps/chosen": -371.0,
"logps/rejected": -441.1000061035156,
"loss": 0.0288,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -0.1243896484375,
"rewards/margins": 10.610937118530273,
"rewards/rejected": -10.733593940734863,
"step": 2150
},
{
"epoch": 1.3900869005471517,
"grad_norm": 8.789538295836175,
"learning_rate": 6.524468770122343e-07,
"logits/chosen": -0.649243175983429,
"logits/rejected": -0.679980456829071,
"logps/chosen": -353.42498779296875,
"logps/rejected": -464.07501220703125,
"loss": 0.0424,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.13173827528953552,
"rewards/margins": 11.746874809265137,
"rewards/rejected": -11.876562118530273,
"step": 2160
},
{
"epoch": 1.3965239781139362,
"grad_norm": 10.025462859350501,
"learning_rate": 6.508370895041854e-07,
"logits/chosen": -0.73486328125,
"logits/rejected": -0.7211669683456421,
"logps/chosen": -390.8500061035156,
"logps/rejected": -462.9750061035156,
"loss": 0.0531,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.454126000404358,
"rewards/margins": 11.36328125,
"rewards/rejected": -12.815625190734863,
"step": 2170
},
{
"epoch": 1.4029610556807208,
"grad_norm": 11.342140558916348,
"learning_rate": 6.492273019961365e-07,
"logits/chosen": -0.7691650390625,
"logits/rejected": -0.7724243402481079,
"logps/chosen": -381.4750061035156,
"logps/rejected": -460.6499938964844,
"loss": 0.0549,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -2.3446898460388184,
"rewards/margins": 10.916406631469727,
"rewards/rejected": -13.258593559265137,
"step": 2180
},
{
"epoch": 1.4093981332475056,
"grad_norm": 0.7950552155099938,
"learning_rate": 6.476175144880875e-07,
"logits/chosen": -0.7981933355331421,
"logits/rejected": -0.8179931640625,
"logps/chosen": -403.0249938964844,
"logps/rejected": -469.625,
"loss": 0.0397,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.8957030773162842,
"rewards/margins": 11.323827743530273,
"rewards/rejected": -13.215624809265137,
"step": 2190
},
{
"epoch": 1.4158352108142904,
"grad_norm": 20.523500260808675,
"learning_rate": 6.460077269800386e-07,
"logits/chosen": -0.7896484136581421,
"logits/rejected": -0.8050537109375,
"logps/chosen": -353.57501220703125,
"logps/rejected": -488.6499938964844,
"loss": 0.0333,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.691693127155304,
"rewards/margins": 11.971094131469727,
"rewards/rejected": -12.664843559265137,
"step": 2200
},
{
"epoch": 1.422272288381075,
"grad_norm": 4.165148973749865,
"learning_rate": 6.443979394719896e-07,
"logits/chosen": -0.7835693359375,
"logits/rejected": -0.8207031488418579,
"logps/chosen": -404.6499938964844,
"logps/rejected": -483.82501220703125,
"loss": 0.0284,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.223669409751892,
"rewards/margins": 11.237500190734863,
"rewards/rejected": -12.465624809265137,
"step": 2210
},
{
"epoch": 1.4287093659478596,
"grad_norm": 5.180688078431531,
"learning_rate": 6.427881519639408e-07,
"logits/chosen": -0.684216320514679,
"logits/rejected": -0.7363525629043579,
"logps/chosen": -403.5249938964844,
"logps/rejected": -505.1000061035156,
"loss": 0.0265,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.9525146484375,
"rewards/margins": 12.81640625,
"rewards/rejected": -14.774999618530273,
"step": 2220
},
{
"epoch": 1.4351464435146444,
"grad_norm": 14.212893761212056,
"learning_rate": 6.411783644558918e-07,
"logits/chosen": -0.8042968511581421,
"logits/rejected": -0.794909656047821,
"logps/chosen": -403.8999938964844,
"logps/rejected": -481.2250061035156,
"loss": 0.0624,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.993322730064392,
"rewards/margins": 11.608593940734863,
"rewards/rejected": -13.594141006469727,
"step": 2230
},
{
"epoch": 1.441583521081429,
"grad_norm": 6.871037130676326,
"learning_rate": 6.395685769478428e-07,
"logits/chosen": -0.700634777545929,
"logits/rejected": -0.715405285358429,
"logps/chosen": -352.38751220703125,
"logps/rejected": -474.79998779296875,
"loss": 0.0557,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.9448608160018921,
"rewards/margins": 10.33984375,
"rewards/rejected": -11.283594131469727,
"step": 2240
},
{
"epoch": 1.4480205986482138,
"grad_norm": 0.18746076155577607,
"learning_rate": 6.379587894397939e-07,
"logits/chosen": -0.752368152141571,
"logits/rejected": -0.7897704839706421,
"logps/chosen": -397.29998779296875,
"logps/rejected": -457.3500061035156,
"loss": 0.0314,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.0015380382537842,
"rewards/margins": 10.325780868530273,
"rewards/rejected": -11.323437690734863,
"step": 2250
},
{
"epoch": 1.4544576762149983,
"grad_norm": 2.5507421968165973,
"learning_rate": 6.363490019317451e-07,
"logits/chosen": -0.742602527141571,
"logits/rejected": -0.7437683343887329,
"logps/chosen": -383.07501220703125,
"logps/rejected": -486.375,
"loss": 0.0506,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.1386229991912842,
"rewards/margins": 12.111719131469727,
"rewards/rejected": -13.255468368530273,
"step": 2260
},
{
"epoch": 1.4608947537817831,
"grad_norm": 2.2763823295013963,
"learning_rate": 6.34739214423696e-07,
"logits/chosen": -0.7447265386581421,
"logits/rejected": -0.748046875,
"logps/chosen": -410.625,
"logps/rejected": -481.70001220703125,
"loss": 0.0478,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.0862915515899658,
"rewards/margins": 10.287500381469727,
"rewards/rejected": -11.372655868530273,
"step": 2270
},
{
"epoch": 1.4673318313485677,
"grad_norm": 0.4260998042645073,
"learning_rate": 6.331294269156471e-07,
"logits/chosen": -0.845996081829071,
"logits/rejected": -0.8616698980331421,
"logps/chosen": -393.95001220703125,
"logps/rejected": -484.67498779296875,
"loss": 0.0348,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.0209228992462158,
"rewards/margins": 11.013280868530273,
"rewards/rejected": -12.045312881469727,
"step": 2280
},
{
"epoch": 1.4737689089153525,
"grad_norm": 123.17291450113709,
"learning_rate": 6.315196394075981e-07,
"logits/chosen": -0.721881091594696,
"logits/rejected": -0.744799792766571,
"logps/chosen": -368.5874938964844,
"logps/rejected": -469.8999938964844,
"loss": 0.0443,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.0027587413787842,
"rewards/margins": 10.260156631469727,
"rewards/rejected": -11.270703315734863,
"step": 2290
},
{
"epoch": 1.480205986482137,
"grad_norm": 17.53638862046089,
"learning_rate": 6.299098518995493e-07,
"logits/chosen": -0.7756592035293579,
"logits/rejected": -0.777020275592804,
"logps/chosen": -386.3999938964844,
"logps/rejected": -475.2749938964844,
"loss": 0.0551,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.0754516124725342,
"rewards/margins": 10.524999618530273,
"rewards/rejected": -11.599218368530273,
"step": 2300
},
{
"epoch": 1.4866430640489217,
"grad_norm": 40.43102058317517,
"learning_rate": 6.283000643915003e-07,
"logits/chosen": -0.7683349847793579,
"logits/rejected": -0.8065429925918579,
"logps/chosen": -340.1499938964844,
"logps/rejected": -432.79998779296875,
"loss": 0.0536,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.523364245891571,
"rewards/margins": 10.595312118530273,
"rewards/rejected": -11.111719131469727,
"step": 2310
},
{
"epoch": 1.4930801416157065,
"grad_norm": 0.9213782840626744,
"learning_rate": 6.266902768834513e-07,
"logits/chosen": -0.7571777105331421,
"logits/rejected": -0.7656280398368835,
"logps/chosen": -394.17498779296875,
"logps/rejected": -493.625,
"loss": 0.0195,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -0.618359386920929,
"rewards/margins": 11.130468368530273,
"rewards/rejected": -11.751562118530273,
"step": 2320
},
{
"epoch": 1.4995172191824913,
"grad_norm": 22.104939943938994,
"learning_rate": 6.250804893754024e-07,
"logits/chosen": -0.784497082233429,
"logits/rejected": -0.773754894733429,
"logps/chosen": -378.79998779296875,
"logps/rejected": -431.25,
"loss": 0.0639,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.8636840581893921,
"rewards/margins": 10.059765815734863,
"rewards/rejected": -10.924219131469727,
"step": 2330
},
{
"epoch": 1.5059542967492758,
"grad_norm": 1.6915245555680156,
"learning_rate": 6.234707018673535e-07,
"logits/chosen": -0.834716796875,
"logits/rejected": -0.8809570074081421,
"logps/chosen": -370.54998779296875,
"logps/rejected": -439.8500061035156,
"loss": 0.052,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.103784203529358,
"rewards/margins": 10.172656059265137,
"rewards/rejected": -11.285937309265137,
"step": 2340
},
{
"epoch": 1.5123913743160604,
"grad_norm": 17.859220853952976,
"learning_rate": 6.218609143593045e-07,
"logits/chosen": -0.827197253704071,
"logits/rejected": -0.8333495855331421,
"logps/chosen": -385.57501220703125,
"logps/rejected": -463.6000061035156,
"loss": 0.0792,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -1.35723876953125,
"rewards/margins": 10.078125,
"rewards/rejected": -11.44140625,
"step": 2350
},
{
"epoch": 1.5188284518828452,
"grad_norm": 0.2607261691968034,
"learning_rate": 6.202511268512556e-07,
"logits/chosen": -0.760913074016571,
"logits/rejected": -0.776318371295929,
"logps/chosen": -389.17498779296875,
"logps/rejected": -465.5249938964844,
"loss": 0.0401,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.0231444835662842,
"rewards/margins": 9.904296875,
"rewards/rejected": -10.931640625,
"step": 2360
},
{
"epoch": 1.52526552944963,
"grad_norm": 15.593710610614462,
"learning_rate": 6.186413393432067e-07,
"logits/chosen": -0.8382812738418579,
"logits/rejected": -0.856738269329071,
"logps/chosen": -407.2250061035156,
"logps/rejected": -464.125,
"loss": 0.0363,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.1426513195037842,
"rewards/margins": 10.119531631469727,
"rewards/rejected": -11.264062881469727,
"step": 2370
},
{
"epoch": 1.5317026070164146,
"grad_norm": 7.034407955917834,
"learning_rate": 6.170315518351577e-07,
"logits/chosen": -0.7542724609375,
"logits/rejected": -0.766064465045929,
"logps/chosen": -378.70001220703125,
"logps/rejected": -481.57501220703125,
"loss": 0.0612,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -1.373419165611267,
"rewards/margins": 10.766406059265137,
"rewards/rejected": -12.145312309265137,
"step": 2380
},
{
"epoch": 1.5381396845831992,
"grad_norm": 6.582834920072221,
"learning_rate": 6.154217643271088e-07,
"logits/chosen": -0.723925769329071,
"logits/rejected": -0.734448254108429,
"logps/chosen": -404.125,
"logps/rejected": -502.75,
"loss": 0.0557,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.978906273841858,
"rewards/margins": 10.76171875,
"rewards/rejected": -12.744531631469727,
"step": 2390
},
{
"epoch": 1.544576762149984,
"grad_norm": 0.4422958879108554,
"learning_rate": 6.138119768190599e-07,
"logits/chosen": -0.8257080316543579,
"logits/rejected": -0.862231433391571,
"logps/chosen": -370.45001220703125,
"logps/rejected": -459.9750061035156,
"loss": 0.047,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.163891553878784,
"rewards/margins": 11.420312881469727,
"rewards/rejected": -13.585156440734863,
"step": 2400
},
{
"epoch": 1.5510138397167685,
"grad_norm": 23.621743283386632,
"learning_rate": 6.122021893110108e-07,
"logits/chosen": -0.7707275152206421,
"logits/rejected": -0.782275378704071,
"logps/chosen": -374.75,
"logps/rejected": -467.54998779296875,
"loss": 0.0745,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -1.935156226158142,
"rewards/margins": 10.9296875,
"rewards/rejected": -12.871874809265137,
"step": 2410
},
{
"epoch": 1.5574509172835533,
"grad_norm": 174.52576579494084,
"learning_rate": 6.10592401802962e-07,
"logits/chosen": -0.825268566608429,
"logits/rejected": -0.830151379108429,
"logps/chosen": -368.95001220703125,
"logps/rejected": -481.8500061035156,
"loss": 0.1028,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.627960205078125,
"rewards/margins": 10.973047256469727,
"rewards/rejected": -12.61328125,
"step": 2420
},
{
"epoch": 1.563887994850338,
"grad_norm": 6.353329449967956,
"learning_rate": 6.08982614294913e-07,
"logits/chosen": -0.8233642578125,
"logits/rejected": -0.8514159917831421,
"logps/chosen": -370.625,
"logps/rejected": -465.70001220703125,
"loss": 0.0247,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.6372802257537842,
"rewards/margins": 10.8671875,
"rewards/rejected": -12.513280868530273,
"step": 2430
},
{
"epoch": 1.5703250724171225,
"grad_norm": 42.632038258106874,
"learning_rate": 6.073728267868641e-07,
"logits/chosen": -0.7555176019668579,
"logits/rejected": -0.775775134563446,
"logps/chosen": -403.6499938964844,
"logps/rejected": -472.1499938964844,
"loss": 0.0496,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.56494140625,
"rewards/margins": 10.884374618530273,
"rewards/rejected": -11.444531440734863,
"step": 2440
},
{
"epoch": 1.5767621499839073,
"grad_norm": 4.234950034854178,
"learning_rate": 6.057630392788152e-07,
"logits/chosen": -0.7583984136581421,
"logits/rejected": -0.771484375,
"logps/chosen": -392.73748779296875,
"logps/rejected": -478.0249938964844,
"loss": 0.0933,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -1.113104224205017,
"rewards/margins": 10.796093940734863,
"rewards/rejected": -11.916406631469727,
"step": 2450
},
{
"epoch": 1.583199227550692,
"grad_norm": 3.9163310479581566,
"learning_rate": 6.041532517707662e-07,
"logits/chosen": -0.8863281011581421,
"logits/rejected": -0.895947277545929,
"logps/chosen": -395.3500061035156,
"logps/rejected": -483.54998779296875,
"loss": 0.0371,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.408911108970642,
"rewards/margins": 11.666406631469727,
"rewards/rejected": -13.063281059265137,
"step": 2460
},
{
"epoch": 1.5896363051174767,
"grad_norm": 62.02613513340239,
"learning_rate": 6.025434642627173e-07,
"logits/chosen": -0.8659423589706421,
"logits/rejected": -0.879638671875,
"logps/chosen": -402.1499938964844,
"logps/rejected": -507.375,
"loss": 0.039,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.2672119140625,
"rewards/margins": 11.375781059265137,
"rewards/rejected": -12.642969131469727,
"step": 2470
},
{
"epoch": 1.5960733826842612,
"grad_norm": 3.3628306955247598,
"learning_rate": 6.009336767546684e-07,
"logits/chosen": -0.891796886920929,
"logits/rejected": -0.920849621295929,
"logps/chosen": -405.875,
"logps/rejected": -493.67498779296875,
"loss": 0.0499,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.6985229253768921,
"rewards/margins": 11.516406059265137,
"rewards/rejected": -12.217968940734863,
"step": 2480
},
{
"epoch": 1.602510460251046,
"grad_norm": 6.944832508288456,
"learning_rate": 5.993238892466194e-07,
"logits/chosen": -0.8244873285293579,
"logits/rejected": -0.838452160358429,
"logps/chosen": -371.3999938964844,
"logps/rejected": -458.82501220703125,
"loss": 0.0703,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.8302001953125,
"rewards/margins": 10.130468368530273,
"rewards/rejected": -10.963281631469727,
"step": 2490
},
{
"epoch": 1.6089475378178308,
"grad_norm": 16.431404128160846,
"learning_rate": 5.977141017385705e-07,
"logits/chosen": -1.0031249523162842,
"logits/rejected": -1.000390648841858,
"logps/chosen": -377.54998779296875,
"logps/rejected": -472.5,
"loss": 0.0395,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -0.730297863483429,
"rewards/margins": 10.501562118530273,
"rewards/rejected": -11.234375,
"step": 2500
},
{
"epoch": 1.6153846153846154,
"grad_norm": 0.9146958952965157,
"learning_rate": 5.961043142305216e-07,
"logits/chosen": -0.8604491949081421,
"logits/rejected": -0.87451171875,
"logps/chosen": -382.51251220703125,
"logps/rejected": -439.375,
"loss": 0.052,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -0.5503753423690796,
"rewards/margins": 9.967187881469727,
"rewards/rejected": -10.515625,
"step": 2510
},
{
"epoch": 1.6218216929514,
"grad_norm": 1.2281780912032512,
"learning_rate": 5.944945267224725e-07,
"logits/chosen": -0.8853515386581421,
"logits/rejected": -0.891796886920929,
"logps/chosen": -390.8500061035156,
"logps/rejected": -468.1499938964844,
"loss": 0.04,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.706024169921875,
"rewards/margins": 11.03125,
"rewards/rejected": -11.733593940734863,
"step": 2520
},
{
"epoch": 1.6282587705181848,
"grad_norm": 0.9436650570997343,
"learning_rate": 5.928847392144237e-07,
"logits/chosen": -0.8895508050918579,
"logits/rejected": -0.8848632574081421,
"logps/chosen": -392.96875,
"logps/rejected": -470.4750061035156,
"loss": 0.0295,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -0.9778808355331421,
"rewards/margins": 10.90625,
"rewards/rejected": -11.883593559265137,
"step": 2530
},
{
"epoch": 1.6346958480849694,
"grad_norm": 0.2775703409910018,
"learning_rate": 5.912749517063748e-07,
"logits/chosen": -0.940356433391571,
"logits/rejected": -0.9769531488418579,
"logps/chosen": -396.0,
"logps/rejected": -452.0249938964844,
"loss": 0.0129,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.201135277748108,
"rewards/margins": 11.169530868530273,
"rewards/rejected": -12.374218940734863,
"step": 2540
},
{
"epoch": 1.6411329256517542,
"grad_norm": 31.914598423294287,
"learning_rate": 5.896651641983258e-07,
"logits/chosen": -1.011376976966858,
"logits/rejected": -1.037695288658142,
"logps/chosen": -381.79998779296875,
"logps/rejected": -435.6499938964844,
"loss": 0.0321,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.6757323741912842,
"rewards/margins": 10.783594131469727,
"rewards/rejected": -12.4609375,
"step": 2550
},
{
"epoch": 1.6475700032185387,
"grad_norm": 72.59157572433088,
"learning_rate": 5.880553766902768e-07,
"logits/chosen": -0.977001965045929,
"logits/rejected": -0.993701159954071,
"logps/chosen": -403.92498779296875,
"logps/rejected": -496.8999938964844,
"loss": 0.0418,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.3961181640625,
"rewards/margins": 11.057031631469727,
"rewards/rejected": -12.449999809265137,
"step": 2560
},
{
"epoch": 1.6540070807853233,
"grad_norm": 14.184682824537003,
"learning_rate": 5.86445589182228e-07,
"logits/chosen": -0.903369128704071,
"logits/rejected": -0.904467761516571,
"logps/chosen": -392.32501220703125,
"logps/rejected": -475.57501220703125,
"loss": 0.0652,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.341552734375,
"rewards/margins": 12.142969131469727,
"rewards/rejected": -13.478124618530273,
"step": 2570
},
{
"epoch": 1.6604441583521081,
"grad_norm": 5.25218753944226,
"learning_rate": 5.84835801674179e-07,
"logits/chosen": -0.955322265625,
"logits/rejected": -0.977343738079071,
"logps/chosen": -375.13751220703125,
"logps/rejected": -466.1499938964844,
"loss": 0.0314,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.451562523841858,
"rewards/margins": 11.546093940734863,
"rewards/rejected": -12.996874809265137,
"step": 2580
},
{
"epoch": 1.666881235918893,
"grad_norm": 0.25832510910108303,
"learning_rate": 5.832260141661301e-07,
"logits/chosen": -0.9334472417831421,
"logits/rejected": -0.955920398235321,
"logps/chosen": -417.75,
"logps/rejected": -496.07501220703125,
"loss": 0.0242,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.4179565906524658,
"rewards/margins": 11.3984375,
"rewards/rejected": -12.81640625,
"step": 2590
},
{
"epoch": 1.6733183134856775,
"grad_norm": 8.01847196423977,
"learning_rate": 5.81616226658081e-07,
"logits/chosen": -0.925707995891571,
"logits/rejected": -0.940673828125,
"logps/chosen": -397.67498779296875,
"logps/rejected": -461.79998779296875,
"loss": 0.0398,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.860571265220642,
"rewards/margins": 11.041406631469727,
"rewards/rejected": -12.903905868530273,
"step": 2600
},
{
"epoch": 1.679755391052462,
"grad_norm": 8.250100146015557,
"learning_rate": 5.800064391500322e-07,
"logits/chosen": -0.935986340045929,
"logits/rejected": -0.957763671875,
"logps/chosen": -415.67498779296875,
"logps/rejected": -511.6000061035156,
"loss": 0.1153,
"rewards/accuracies": 0.9375,
"rewards/chosen": -2.994311571121216,
"rewards/margins": 11.036718368530273,
"rewards/rejected": -14.035937309265137,
"step": 2610
},
{
"epoch": 1.6861924686192469,
"grad_norm": 13.134105792412328,
"learning_rate": 5.783966516419833e-07,
"logits/chosen": -0.983447253704071,
"logits/rejected": -0.974560558795929,
"logps/chosen": -386.82501220703125,
"logps/rejected": -476.75,
"loss": 0.0335,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.349414110183716,
"rewards/margins": 11.560155868530273,
"rewards/rejected": -13.899999618530273,
"step": 2620
},
{
"epoch": 1.6926295461860317,
"grad_norm": 116.36227986157657,
"learning_rate": 5.767868641339343e-07,
"logits/chosen": -0.8326416015625,
"logits/rejected": -0.829663097858429,
"logps/chosen": -353.1499938964844,
"logps/rejected": -462.7749938964844,
"loss": 0.0935,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -2.1159729957580566,
"rewards/margins": 11.43359375,
"rewards/rejected": -13.545312881469727,
"step": 2630
},
{
"epoch": 1.6990666237528163,
"grad_norm": 4.5619674703943085,
"learning_rate": 5.751770766258853e-07,
"logits/chosen": -0.8194214105606079,
"logits/rejected": -0.84722900390625,
"logps/chosen": -422.07501220703125,
"logps/rejected": -498.375,
"loss": 0.0954,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -1.7252624034881592,
"rewards/margins": 10.96875,
"rewards/rejected": -12.690625190734863,
"step": 2640
},
{
"epoch": 1.7055037013196008,
"grad_norm": 3.006491121324236,
"learning_rate": 5.735672891178365e-07,
"logits/chosen": -0.9326721429824829,
"logits/rejected": -0.929638683795929,
"logps/chosen": -418.79998779296875,
"logps/rejected": -483.8999938964844,
"loss": 0.0323,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.345507860183716,
"rewards/margins": 11.989062309265137,
"rewards/rejected": -14.334375381469727,
"step": 2650
},
{
"epoch": 1.7119407788863856,
"grad_norm": 4.13341575346933,
"learning_rate": 5.719575016097875e-07,
"logits/chosen": -0.828857421875,
"logits/rejected": -0.8162841796875,
"logps/chosen": -356.2250061035156,
"logps/rejected": -526.7000122070312,
"loss": 0.045,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -3.123608350753784,
"rewards/margins": 13.339062690734863,
"rewards/rejected": -16.462499618530273,
"step": 2660
},
{
"epoch": 1.7183778564531704,
"grad_norm": 22.117373309483987,
"learning_rate": 5.703477141017385e-07,
"logits/chosen": -0.844775378704071,
"logits/rejected": -0.8448730707168579,
"logps/chosen": -404.32501220703125,
"logps/rejected": -502.25,
"loss": 0.0476,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.886608839035034,
"rewards/margins": 12.126562118530273,
"rewards/rejected": -16.014062881469727,
"step": 2670
},
{
"epoch": 1.724814934019955,
"grad_norm": 22.82723612005747,
"learning_rate": 5.687379265936896e-07,
"logits/chosen": -0.9837402105331421,
"logits/rejected": -1.027099609375,
"logps/chosen": -404.8999938964844,
"logps/rejected": -503.8999938964844,
"loss": 0.0874,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -5.081250190734863,
"rewards/margins": 12.1015625,
"rewards/rejected": -17.173437118530273,
"step": 2680
},
{
"epoch": 1.7312520115867396,
"grad_norm": 10.704380536262521,
"learning_rate": 5.671281390856407e-07,
"logits/chosen": -0.9532226324081421,
"logits/rejected": -0.9735351800918579,
"logps/chosen": -422.7749938964844,
"logps/rejected": -521.2999877929688,
"loss": 0.0372,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.213476657867432,
"rewards/margins": 12.93359375,
"rewards/rejected": -17.1484375,
"step": 2690
},
{
"epoch": 1.7376890891535242,
"grad_norm": 2.73829439018618,
"learning_rate": 5.655183515775918e-07,
"logits/chosen": -0.94189453125,
"logits/rejected": -0.97607421875,
"logps/chosen": -440.29998779296875,
"logps/rejected": -522.8499755859375,
"loss": 0.0201,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.729840040206909,
"rewards/margins": 12.442187309265137,
"rewards/rejected": -15.1640625,
"step": 2700
},
{
"epoch": 1.744126166720309,
"grad_norm": 36.282664030023824,
"learning_rate": 5.639085640695428e-07,
"logits/chosen": -0.8478027582168579,
"logits/rejected": -0.8516601324081421,
"logps/chosen": -416.2250061035156,
"logps/rejected": -503.7749938964844,
"loss": 0.151,
"rewards/accuracies": 0.925000011920929,
"rewards/chosen": -2.7637696266174316,
"rewards/margins": 11.846875190734863,
"rewards/rejected": -14.606249809265137,
"step": 2710
},
{
"epoch": 1.7505632442870938,
"grad_norm": 2.1283637906112407,
"learning_rate": 5.622987765614938e-07,
"logits/chosen": -0.9247070550918579,
"logits/rejected": -0.9312499761581421,
"logps/chosen": -409.7749938964844,
"logps/rejected": -511.5,
"loss": 0.0602,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -2.046765089035034,
"rewards/margins": 12.314062118530273,
"rewards/rejected": -14.3515625,
"step": 2720
},
{
"epoch": 1.7570003218538783,
"grad_norm": 134.5608375076651,
"learning_rate": 5.60688989053445e-07,
"logits/chosen": -0.8810790777206421,
"logits/rejected": -0.922985851764679,
"logps/chosen": -412.5,
"logps/rejected": -479.42498779296875,
"loss": 0.083,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.50537109375,
"rewards/margins": 11.076562881469727,
"rewards/rejected": -13.574999809265137,
"step": 2730
},
{
"epoch": 1.763437399420663,
"grad_norm": 44.62636520944944,
"learning_rate": 5.590792015453961e-07,
"logits/chosen": -0.8690429925918579,
"logits/rejected": -0.862597644329071,
"logps/chosen": -439.42498779296875,
"logps/rejected": -518.0999755859375,
"loss": 0.0385,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.424877882003784,
"rewards/margins": 12.205469131469727,
"rewards/rejected": -14.629687309265137,
"step": 2740
},
{
"epoch": 1.7698744769874477,
"grad_norm": 11.000258418597038,
"learning_rate": 5.57469414037347e-07,
"logits/chosen": -0.8440917730331421,
"logits/rejected": -0.877392590045929,
"logps/chosen": -431.0,
"logps/rejected": -490.1000061035156,
"loss": 0.0655,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -2.1365966796875,
"rewards/margins": 11.603124618530273,
"rewards/rejected": -13.740625381469727,
"step": 2750
},
{
"epoch": 1.7763115545542325,
"grad_norm": 24.728950785009513,
"learning_rate": 5.558596265292981e-07,
"logits/chosen": -0.793408215045929,
"logits/rejected": -0.82470703125,
"logps/chosen": -384.2250061035156,
"logps/rejected": -455.75,
"loss": 0.0423,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.9411132335662842,
"rewards/margins": 11.362500190734863,
"rewards/rejected": -13.303125381469727,
"step": 2760
},
{
"epoch": 1.782748632121017,
"grad_norm": 18.185794833969,
"learning_rate": 5.542498390212492e-07,
"logits/chosen": -0.8042999505996704,
"logits/rejected": -0.7938781976699829,
"logps/chosen": -376.0,
"logps/rejected": -467.70001220703125,
"loss": 0.0949,
"rewards/accuracies": 0.9312499761581421,
"rewards/chosen": -1.829443335533142,
"rewards/margins": 10.978906631469727,
"rewards/rejected": -12.80078125,
"step": 2770
},
{
"epoch": 1.7891857096878017,
"grad_norm": 36.77834630320014,
"learning_rate": 5.526400515132002e-07,
"logits/chosen": -0.898144543170929,
"logits/rejected": -0.8753417730331421,
"logps/chosen": -413.8999938964844,
"logps/rejected": -524.0999755859375,
"loss": 0.0878,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -2.239550828933716,
"rewards/margins": 11.630468368530273,
"rewards/rejected": -13.878125190734863,
"step": 2780
},
{
"epoch": 1.7956227872545865,
"grad_norm": 50.535377745071834,
"learning_rate": 5.510302640051513e-07,
"logits/chosen": -0.871777355670929,
"logits/rejected": -0.909472644329071,
"logps/chosen": -396.1000061035156,
"logps/rejected": -475.0,
"loss": 0.037,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.981176733970642,
"rewards/margins": 11.844531059265137,
"rewards/rejected": -13.824999809265137,
"step": 2790
},
{
"epoch": 1.8020598648213713,
"grad_norm": 187.81436429316912,
"learning_rate": 5.494204764971023e-07,
"logits/chosen": -0.8958984613418579,
"logits/rejected": -0.9166015386581421,
"logps/chosen": -413.04998779296875,
"logps/rejected": -503.125,
"loss": 0.0652,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.3756103515625,
"rewards/margins": 11.768750190734863,
"rewards/rejected": -14.146875381469727,
"step": 2800
},
{
"epoch": 1.8084969423881558,
"grad_norm": 2.46028333934951,
"learning_rate": 5.478106889890535e-07,
"logits/chosen": -0.9292968511581421,
"logits/rejected": -0.9300781488418579,
"logps/chosen": -367.375,
"logps/rejected": -495.1000061035156,
"loss": 0.0362,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.463037133216858,
"rewards/margins": 12.038281440734863,
"rewards/rejected": -13.5078125,
"step": 2810
},
{
"epoch": 1.8149340199549404,
"grad_norm": 231.08328656997156,
"learning_rate": 5.462009014810045e-07,
"logits/chosen": -0.952929675579071,
"logits/rejected": -0.947460949420929,
"logps/chosen": -433.07501220703125,
"logps/rejected": -511.25,
"loss": 0.0422,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.267065405845642,
"rewards/margins": 13.215624809265137,
"rewards/rejected": -14.4765625,
"step": 2820
},
{
"epoch": 1.821371097521725,
"grad_norm": 20.163208476823606,
"learning_rate": 5.445911139729555e-07,
"logits/chosen": -0.944793701171875,
"logits/rejected": -0.9900878667831421,
"logps/chosen": -394.07501220703125,
"logps/rejected": -501.0,
"loss": 0.0365,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.1129150390625,
"rewards/margins": 12.45703125,
"rewards/rejected": -14.5625,
"step": 2830
},
{
"epoch": 1.8278081750885098,
"grad_norm": 144.33944891843873,
"learning_rate": 5.429813264649066e-07,
"logits/chosen": -0.917529284954071,
"logits/rejected": -0.927441418170929,
"logps/chosen": -393.42498779296875,
"logps/rejected": -512.9500122070312,
"loss": 0.0597,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -2.2644286155700684,
"rewards/margins": 12.955469131469727,
"rewards/rejected": -15.217187881469727,
"step": 2840
},
{
"epoch": 1.8342452526552946,
"grad_norm": 21.552588183350537,
"learning_rate": 5.413715389568578e-07,
"logits/chosen": -0.94049072265625,
"logits/rejected": -0.9557861089706421,
"logps/chosen": -371.3374938964844,
"logps/rejected": -473.95001220703125,
"loss": 0.0413,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.8835632801055908,
"rewards/margins": 12.410937309265137,
"rewards/rejected": -14.28515625,
"step": 2850
},
{
"epoch": 1.8406823302220792,
"grad_norm": 0.33607759158894557,
"learning_rate": 5.397617514488087e-07,
"logits/chosen": -1.03466796875,
"logits/rejected": -1.0185546875,
"logps/chosen": -397.7749938964844,
"logps/rejected": -503.3500061035156,
"loss": 0.1239,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.576586961746216,
"rewards/margins": 11.790624618530273,
"rewards/rejected": -14.370312690734863,
"step": 2860
},
{
"epoch": 1.8471194077888637,
"grad_norm": 7.301426102324497,
"learning_rate": 5.381519639407598e-07,
"logits/chosen": -0.9674316644668579,
"logits/rejected": -0.9830077886581421,
"logps/chosen": -387.2250061035156,
"logps/rejected": -525.6500244140625,
"loss": 0.0404,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.5799803733825684,
"rewards/margins": 12.387499809265137,
"rewards/rejected": -15.962499618530273,
"step": 2870
},
{
"epoch": 1.8535564853556485,
"grad_norm": 8.160121310799461,
"learning_rate": 5.365421764327109e-07,
"logits/chosen": -1.011450171470642,
"logits/rejected": -1.022363305091858,
"logps/chosen": -412.375,
"logps/rejected": -507.95001220703125,
"loss": 0.1486,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.354541063308716,
"rewards/margins": 11.653124809265137,
"rewards/rejected": -15.006250381469727,
"step": 2880
},
{
"epoch": 1.8599935629224333,
"grad_norm": 5.827434791236949,
"learning_rate": 5.34932388924662e-07,
"logits/chosen": -0.955517590045929,
"logits/rejected": -0.963061511516571,
"logps/chosen": -429.04998779296875,
"logps/rejected": -512.7125244140625,
"loss": 0.1118,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -3.6991209983825684,
"rewards/margins": 12.186718940734863,
"rewards/rejected": -15.900781631469727,
"step": 2890
},
{
"epoch": 1.866430640489218,
"grad_norm": 4.154458697921168,
"learning_rate": 5.33322601416613e-07,
"logits/chosen": -0.95458984375,
"logits/rejected": -0.9620605707168579,
"logps/chosen": -408.5249938964844,
"logps/rejected": -510.5,
"loss": 0.056,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.6628174781799316,
"rewards/margins": 11.815625190734863,
"rewards/rejected": -14.484375,
"step": 2900
},
{
"epoch": 1.8728677180560025,
"grad_norm": 25.750618944342897,
"learning_rate": 5.31712813908564e-07,
"logits/chosen": -0.978076159954071,
"logits/rejected": -0.968994140625,
"logps/chosen": -376.70001220703125,
"logps/rejected": -513.2000122070312,
"loss": 0.0537,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.340625047683716,
"rewards/margins": 11.696874618530273,
"rewards/rejected": -14.035937309265137,
"step": 2910
},
{
"epoch": 1.8793047956227873,
"grad_norm": 34.482062477676116,
"learning_rate": 5.301030264005151e-07,
"logits/chosen": -0.887988269329071,
"logits/rejected": -0.9131835699081421,
"logps/chosen": -393.8999938964844,
"logps/rejected": -460.1499938964844,
"loss": 0.034,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.0007812976837158,
"rewards/margins": 11.300000190734863,
"rewards/rejected": -12.290624618530273,
"step": 2920
},
{
"epoch": 1.885741873189572,
"grad_norm": 0.6449608149453013,
"learning_rate": 5.284932388924662e-07,
"logits/chosen": -0.908447265625,
"logits/rejected": -0.928955078125,
"logps/chosen": -366.4624938964844,
"logps/rejected": -453.07501220703125,
"loss": 0.0462,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.143225073814392,
"rewards/margins": 11.33984375,
"rewards/rejected": -12.48046875,
"step": 2930
},
{
"epoch": 1.8921789507563567,
"grad_norm": 10.761664351455913,
"learning_rate": 5.268834513844172e-07,
"logits/chosen": -0.9051758050918579,
"logits/rejected": -0.942919909954071,
"logps/chosen": -378.25,
"logps/rejected": -482.6000061035156,
"loss": 0.0644,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.2742919921875,
"rewards/margins": 10.936327934265137,
"rewards/rejected": -12.215624809265137,
"step": 2940
},
{
"epoch": 1.8986160283231412,
"grad_norm": 91.23334834373519,
"learning_rate": 5.252736638763683e-07,
"logits/chosen": -0.938720703125,
"logits/rejected": -0.9503418207168579,
"logps/chosen": -413.625,
"logps/rejected": -475.70001220703125,
"loss": 0.0455,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.732348620891571,
"rewards/margins": 11.340624809265137,
"rewards/rejected": -12.078125,
"step": 2950
},
{
"epoch": 1.9050531058899258,
"grad_norm": 12.915735407500012,
"learning_rate": 5.236638763683194e-07,
"logits/chosen": -0.85382080078125,
"logits/rejected": -0.871350109577179,
"logps/chosen": -366.95001220703125,
"logps/rejected": -493.75,
"loss": 0.0473,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -0.8136841058731079,
"rewards/margins": 11.69140625,
"rewards/rejected": -12.508593559265137,
"step": 2960
},
{
"epoch": 1.9114901834567106,
"grad_norm": 227.12309414417433,
"learning_rate": 5.220540888602704e-07,
"logits/chosen": -0.9459472894668579,
"logits/rejected": -0.935351550579071,
"logps/chosen": -412.7749938964844,
"logps/rejected": -502.0,
"loss": 0.0448,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.43291014432907104,
"rewards/margins": 11.698437690734863,
"rewards/rejected": -12.13671875,
"step": 2970
},
{
"epoch": 1.9179272610234954,
"grad_norm": 0.196421800385388,
"learning_rate": 5.204443013522215e-07,
"logits/chosen": -0.9383789300918579,
"logits/rejected": -0.953320324420929,
"logps/chosen": -379.6000061035156,
"logps/rejected": -474.6499938964844,
"loss": 0.0569,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -1.2946655750274658,
"rewards/margins": 11.255078315734863,
"rewards/rejected": -12.55078125,
"step": 2980
},
{
"epoch": 1.92436433859028,
"grad_norm": 1.346626934480126,
"learning_rate": 5.188345138441726e-07,
"logits/chosen": -0.924121081829071,
"logits/rejected": -0.9498046636581421,
"logps/chosen": -392.54998779296875,
"logps/rejected": -464.4750061035156,
"loss": 0.0398,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -0.9569946527481079,
"rewards/margins": 11.33203125,
"rewards/rejected": -12.289843559265137,
"step": 2990
},
{
"epoch": 1.9308014161570646,
"grad_norm": 8.375416288346715,
"learning_rate": 5.172247263361235e-07,
"logits/chosen": -1.010498046875,
"logits/rejected": -1.031152367591858,
"logps/chosen": -442.7250061035156,
"logps/rejected": -524.5999755859375,
"loss": 0.031,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -1.4194824695587158,
"rewards/margins": 12.033594131469727,
"rewards/rejected": -13.460156440734863,
"step": 3000
},
{
"epoch": 1.9372384937238494,
"grad_norm": 12.910753832152915,
"learning_rate": 5.156149388280747e-07,
"logits/chosen": -0.9345703125,
"logits/rejected": -0.956250011920929,
"logps/chosen": -392.625,
"logps/rejected": -460.6499938964844,
"loss": 0.0398,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.1406006813049316,
"rewards/margins": 12.096094131469727,
"rewards/rejected": -14.235937118530273,
"step": 3010
},
{
"epoch": 1.9436755712906342,
"grad_norm": 1.0305047534231448,
"learning_rate": 5.140051513200258e-07,
"logits/chosen": -0.94677734375,
"logits/rejected": -0.9766601324081421,
"logps/chosen": -381.4750061035156,
"logps/rejected": -468.8500061035156,
"loss": 0.0257,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.2906372547149658,
"rewards/margins": 11.268750190734863,
"rewards/rejected": -12.560155868530273,
"step": 3020
},
{
"epoch": 1.9501126488574188,
"grad_norm": 0.36209350367976334,
"learning_rate": 5.123953638119768e-07,
"logits/chosen": -1.013085961341858,
"logits/rejected": -1.033300757408142,
"logps/chosen": -421.5249938964844,
"logps/rejected": -502.75,
"loss": 0.0626,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.6013672351837158,
"rewards/margins": 11.564844131469727,
"rewards/rejected": -13.159375190734863,
"step": 3030
},
{
"epoch": 1.9565497264242033,
"grad_norm": 11.479780504467316,
"learning_rate": 5.107855763039278e-07,
"logits/chosen": -1.0580322742462158,
"logits/rejected": -1.06884765625,
"logps/chosen": -393.7749938964844,
"logps/rejected": -477.07501220703125,
"loss": 0.0234,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -1.379449486732483,
"rewards/margins": 11.125781059265137,
"rewards/rejected": -12.494531631469727,
"step": 3040
},
{
"epoch": 1.9629868039909881,
"grad_norm": 18.87941406876472,
"learning_rate": 5.09175788795879e-07,
"logits/chosen": -0.984814465045929,
"logits/rejected": -1.028466820716858,
"logps/chosen": -381.54998779296875,
"logps/rejected": -484.4750061035156,
"loss": 0.0733,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -1.355200171470642,
"rewards/margins": 12.080469131469727,
"rewards/rejected": -13.435937881469727,
"step": 3050
},
{
"epoch": 1.969423881557773,
"grad_norm": 46.197107715130024,
"learning_rate": 5.0756600128783e-07,
"logits/chosen": -1.0607421398162842,
"logits/rejected": -1.0695312023162842,
"logps/chosen": -407.5249938964844,
"logps/rejected": -496.1000061035156,
"loss": 0.0459,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.9796385765075684,
"rewards/margins": 12.356249809265137,
"rewards/rejected": -15.340624809265137,
"step": 3060
},
{
"epoch": 1.9758609591245575,
"grad_norm": 2.624768811992857,
"learning_rate": 5.059562137797811e-07,
"logits/chosen": -1.1554687023162842,
"logits/rejected": -1.15771484375,
"logps/chosen": -403.79998779296875,
"logps/rejected": -472.04998779296875,
"loss": 0.0206,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.441601514816284,
"rewards/margins": 12.533594131469727,
"rewards/rejected": -15.979687690734863,
"step": 3070
},
{
"epoch": 1.982298036691342,
"grad_norm": 1.3093063165499863,
"learning_rate": 5.04346426271732e-07,
"logits/chosen": -1.0871093273162842,
"logits/rejected": -1.099609375,
"logps/chosen": -447.0249938964844,
"logps/rejected": -526.1500244140625,
"loss": 0.0173,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.60986328125,
"rewards/margins": 13.119531631469727,
"rewards/rejected": -16.731250762939453,
"step": 3080
},
{
"epoch": 1.9887351142581267,
"grad_norm": 0.12450097571649546,
"learning_rate": 5.027366387636832e-07,
"logits/chosen": -1.007080078125,
"logits/rejected": -1.0055663585662842,
"logps/chosen": -383.2749938964844,
"logps/rejected": -498.3500061035156,
"loss": 0.0646,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -4.04296875,
"rewards/margins": 12.362500190734863,
"rewards/rejected": -16.412500381469727,
"step": 3090
},
{
"epoch": 1.9951721918249115,
"grad_norm": 1.3344752910311428,
"learning_rate": 5.011268512556343e-07,
"logits/chosen": -1.055419921875,
"logits/rejected": -1.0906250476837158,
"logps/chosen": -408.9750061035156,
"logps/rejected": -504.7250061035156,
"loss": 0.0326,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.272106885910034,
"rewards/margins": 12.796093940734863,
"rewards/rejected": -16.071094512939453,
"step": 3100
},
{
"epoch": 2.001287415513357,
"grad_norm": 0.1077285501528772,
"learning_rate": 4.995170637475852e-07,
"logits/chosen": -1.0288857221603394,
"logits/rejected": -1.0637335777282715,
"logps/chosen": -362.5789489746094,
"logps/rejected": -500.15789794921875,
"loss": 0.0212,
"rewards/accuracies": 0.9934210777282715,
"rewards/chosen": -3.1022307872772217,
"rewards/margins": 13.444901466369629,
"rewards/rejected": -16.542762756347656,
"step": 3110
},
{
"epoch": 2.0077244930801417,
"grad_norm": 0.09265850851102228,
"learning_rate": 4.979072762395364e-07,
"logits/chosen": -1.086035132408142,
"logits/rejected": -1.103613257408142,
"logps/chosen": -406.2749938964844,
"logps/rejected": -530.4000244140625,
"loss": 0.0227,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -1.9188964366912842,
"rewards/margins": 15.073437690734863,
"rewards/rejected": -16.998437881469727,
"step": 3120
},
{
"epoch": 2.0141615706469262,
"grad_norm": 3.06968476113232,
"learning_rate": 4.962974887314874e-07,
"logits/chosen": -1.0173828601837158,
"logits/rejected": -1.0482666492462158,
"logps/chosen": -374.79998779296875,
"logps/rejected": -495.29998779296875,
"loss": 0.0458,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -2.3733763694763184,
"rewards/margins": 15.339062690734863,
"rewards/rejected": -17.7109375,
"step": 3130
},
{
"epoch": 2.020598648213711,
"grad_norm": 6.148575080941695,
"learning_rate": 4.946877012234385e-07,
"logits/chosen": -1.033300757408142,
"logits/rejected": -1.0410645008087158,
"logps/chosen": -366.11248779296875,
"logps/rejected": -507.20001220703125,
"loss": 0.0245,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.705615282058716,
"rewards/margins": 14.09765625,
"rewards/rejected": -16.806249618530273,
"step": 3140
},
{
"epoch": 2.027035725780496,
"grad_norm": 3.966203474050368,
"learning_rate": 4.930779137153895e-07,
"logits/chosen": -0.929516613483429,
"logits/rejected": -0.9665282964706421,
"logps/chosen": -374.4750061035156,
"logps/rejected": -498.2749938964844,
"loss": 0.0152,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.3712525367736816,
"rewards/margins": 14.732030868530273,
"rewards/rejected": -17.109375,
"step": 3150
},
{
"epoch": 2.0334728033472804,
"grad_norm": 0.1594348793038751,
"learning_rate": 4.914681262073406e-07,
"logits/chosen": -1.0707519054412842,
"logits/rejected": -1.0604248046875,
"logps/chosen": -389.5,
"logps/rejected": -529.5,
"loss": 0.0136,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.8618407249450684,
"rewards/margins": 15.59375,
"rewards/rejected": -18.470312118530273,
"step": 3160
},
{
"epoch": 2.039909880914065,
"grad_norm": 0.014532573399047911,
"learning_rate": 4.898583386992917e-07,
"logits/chosen": -1.038476586341858,
"logits/rejected": -1.043554663658142,
"logps/chosen": -366.57501220703125,
"logps/rejected": -519.25,
"loss": 0.0406,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -2.771923780441284,
"rewards/margins": 15.8203125,
"rewards/rejected": -18.603124618530273,
"step": 3170
},
{
"epoch": 2.0463469584808496,
"grad_norm": 0.7015845235202134,
"learning_rate": 4.882485511912428e-07,
"logits/chosen": -1.0251953601837158,
"logits/rejected": -1.0403563976287842,
"logps/chosen": -433.5375061035156,
"logps/rejected": -579.0,
"loss": 0.0147,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.81591796875,
"rewards/margins": 16.274999618530273,
"rewards/rejected": -20.09375,
"step": 3180
},
{
"epoch": 2.052784036047634,
"grad_norm": 0.11338404332547947,
"learning_rate": 4.866387636831938e-07,
"logits/chosen": -1.0687987804412842,
"logits/rejected": -1.0724608898162842,
"logps/chosen": -381.3999938964844,
"logps/rejected": -527.0499877929688,
"loss": 0.0854,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -4.091454982757568,
"rewards/margins": 15.41796875,
"rewards/rejected": -19.514062881469727,
"step": 3190
},
{
"epoch": 2.059221113614419,
"grad_norm": 0.07307065029187323,
"learning_rate": 4.850289761751449e-07,
"logits/chosen": -1.0838134288787842,
"logits/rejected": -1.1128661632537842,
"logps/chosen": -390.20001220703125,
"logps/rejected": -526.5499877929688,
"loss": 0.0145,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.879467725753784,
"rewards/margins": 15.40625,
"rewards/rejected": -19.292186737060547,
"step": 3200
},
{
"epoch": 2.0656581911812038,
"grad_norm": 0.4252136551579939,
"learning_rate": 4.834191886670959e-07,
"logits/chosen": -1.02734375,
"logits/rejected": -1.0543944835662842,
"logps/chosen": -434.95001220703125,
"logps/rejected": -551.9500122070312,
"loss": 0.0057,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.806933641433716,
"rewards/margins": 15.7109375,
"rewards/rejected": -19.514062881469727,
"step": 3210
},
{
"epoch": 2.0720952687479883,
"grad_norm": 0.22065842973577401,
"learning_rate": 4.818094011590471e-07,
"logits/chosen": -1.009033203125,
"logits/rejected": -1.04412841796875,
"logps/chosen": -389.54998779296875,
"logps/rejected": -543.875,
"loss": 0.0228,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.7743163108825684,
"rewards/margins": 16.923437118530273,
"rewards/rejected": -20.692188262939453,
"step": 3220
},
{
"epoch": 2.078532346314773,
"grad_norm": 3.366783353939681,
"learning_rate": 4.80199613650998e-07,
"logits/chosen": -1.0969727039337158,
"logits/rejected": -1.1025390625,
"logps/chosen": -449.0249938964844,
"logps/rejected": -566.5499877929688,
"loss": 0.0137,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.6866211891174316,
"rewards/margins": 16.260936737060547,
"rewards/rejected": -19.940624237060547,
"step": 3230
},
{
"epoch": 2.084969423881558,
"grad_norm": 1.3351611741915037,
"learning_rate": 4.785898261429491e-07,
"logits/chosen": -1.1100585460662842,
"logits/rejected": -1.1037108898162842,
"logps/chosen": -400.375,
"logps/rejected": -533.0999755859375,
"loss": 0.0096,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.844922065734863,
"rewards/margins": 15.753125190734863,
"rewards/rejected": -20.606250762939453,
"step": 3240
},
{
"epoch": 2.0914065014483425,
"grad_norm": 0.671875093679778,
"learning_rate": 4.769800386349002e-07,
"logits/chosen": -1.1155273914337158,
"logits/rejected": -1.1248047351837158,
"logps/chosen": -423.29998779296875,
"logps/rejected": -563.4500122070312,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.465918064117432,
"rewards/margins": 15.721875190734863,
"rewards/rejected": -20.184375762939453,
"step": 3250
},
{
"epoch": 2.097843579015127,
"grad_norm": 12.140898346072861,
"learning_rate": 4.7537025112685124e-07,
"logits/chosen": -1.0279541015625,
"logits/rejected": -1.0253509283065796,
"logps/chosen": -385.79998779296875,
"logps/rejected": -513.7249755859375,
"loss": 0.0232,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.7276854515075684,
"rewards/margins": 14.610937118530273,
"rewards/rejected": -18.337499618530273,
"step": 3260
},
{
"epoch": 2.1042806565819117,
"grad_norm": 2.623763638066555,
"learning_rate": 4.7376046361880226e-07,
"logits/chosen": -1.017480492591858,
"logits/rejected": -1.009667992591858,
"logps/chosen": -428.0,
"logps/rejected": -552.2249755859375,
"loss": 0.0279,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -3.2283692359924316,
"rewards/margins": 16.339061737060547,
"rewards/rejected": -19.5703125,
"step": 3270
},
{
"epoch": 2.1107177341486967,
"grad_norm": 0.4497581563597138,
"learning_rate": 4.721506761107534e-07,
"logits/chosen": -1.0849609375,
"logits/rejected": -1.1357421875,
"logps/chosen": -423.75,
"logps/rejected": -557.0,
"loss": 0.0014,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.2232909202575684,
"rewards/margins": 16.860937118530273,
"rewards/rejected": -20.0859375,
"step": 3280
},
{
"epoch": 2.1171548117154813,
"grad_norm": 1.3339774174292212,
"learning_rate": 4.705408886027044e-07,
"logits/chosen": -0.9937744140625,
"logits/rejected": -0.982617199420929,
"logps/chosen": -368.25,
"logps/rejected": -534.9000244140625,
"loss": 0.0594,
"rewards/accuracies": 0.9437500238418579,
"rewards/chosen": -3.929394483566284,
"rewards/margins": 16.626562118530273,
"rewards/rejected": -20.557811737060547,
"step": 3290
},
{
"epoch": 2.123591889282266,
"grad_norm": 0.0051571726531345384,
"learning_rate": 4.689311010946555e-07,
"logits/chosen": -1.063818335533142,
"logits/rejected": -1.061132788658142,
"logps/chosen": -383.9750061035156,
"logps/rejected": -543.3499755859375,
"loss": 0.0181,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.5445799827575684,
"rewards/margins": 16.131250381469727,
"rewards/rejected": -19.682811737060547,
"step": 3300
},
{
"epoch": 2.1300289668490504,
"grad_norm": 0.059582082026372385,
"learning_rate": 4.6732131358660656e-07,
"logits/chosen": -0.9920898675918579,
"logits/rejected": -1.022851586341858,
"logps/chosen": -393.1499938964844,
"logps/rejected": -518.4000244140625,
"loss": 0.0238,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.5086913108825684,
"rewards/margins": 14.434374809265137,
"rewards/rejected": -17.932811737060547,
"step": 3310
},
{
"epoch": 2.136466044415835,
"grad_norm": 0.05020904902019842,
"learning_rate": 4.6571152607855763e-07,
"logits/chosen": -0.925341784954071,
"logits/rejected": -0.948437511920929,
"logps/chosen": -405.0,
"logps/rejected": -542.6500244140625,
"loss": 0.025,
"rewards/accuracies": 0.96875,
"rewards/chosen": -1.8140380382537842,
"rewards/margins": 16.903125762939453,
"rewards/rejected": -18.720312118530273,
"step": 3320
},
{
"epoch": 2.14290312198262,
"grad_norm": 0.9021303309972339,
"learning_rate": 4.6410173857050865e-07,
"logits/chosen": -1.002783179283142,
"logits/rejected": -0.99658203125,
"logps/chosen": -420.1000061035156,
"logps/rejected": -559.9500122070312,
"loss": 0.0169,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.581494331359863,
"rewards/margins": 15.056249618530273,
"rewards/rejected": -19.6328125,
"step": 3330
},
{
"epoch": 2.1493401995494046,
"grad_norm": 0.3791121350351295,
"learning_rate": 4.624919510624598e-07,
"logits/chosen": -1.060644507408142,
"logits/rejected": -1.098242163658142,
"logps/chosen": -393.42498779296875,
"logps/rejected": -543.2999877929688,
"loss": 0.0144,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.459033250808716,
"rewards/margins": 16.667186737060547,
"rewards/rejected": -20.120311737060547,
"step": 3340
},
{
"epoch": 2.155777277116189,
"grad_norm": 0.045148022238358086,
"learning_rate": 4.608821635544108e-07,
"logits/chosen": -0.9743896722793579,
"logits/rejected": -1.025634765625,
"logps/chosen": -433.61248779296875,
"logps/rejected": -542.5499877929688,
"loss": 0.0166,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.9928221702575684,
"rewards/margins": 16.131250381469727,
"rewards/rejected": -19.1328125,
"step": 3350
},
{
"epoch": 2.1622143546829737,
"grad_norm": 0.7861734963114936,
"learning_rate": 4.5927237604636187e-07,
"logits/chosen": -0.998339831829071,
"logits/rejected": -1.03173828125,
"logps/chosen": -432.07501220703125,
"logps/rejected": -545.2999877929688,
"loss": 0.0151,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.386035203933716,
"rewards/margins": 15.671875,
"rewards/rejected": -19.059375762939453,
"step": 3360
},
{
"epoch": 2.1686514322497588,
"grad_norm": 0.25553750983202145,
"learning_rate": 4.576625885383129e-07,
"logits/chosen": -0.948168933391571,
"logits/rejected": -0.9716796875,
"logps/chosen": -445.82501220703125,
"logps/rejected": -577.1500244140625,
"loss": 0.0047,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.176953077316284,
"rewards/margins": 16.501562118530273,
"rewards/rejected": -19.682811737060547,
"step": 3370
},
{
"epoch": 2.1750885098165433,
"grad_norm": 0.29127717157768923,
"learning_rate": 4.56052801030264e-07,
"logits/chosen": -1.062585473060608,
"logits/rejected": -1.0586426258087158,
"logps/chosen": -405.9750061035156,
"logps/rejected": -540.9249877929688,
"loss": 0.0088,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.174121141433716,
"rewards/margins": 15.868749618530273,
"rewards/rejected": -19.057811737060547,
"step": 3380
},
{
"epoch": 2.181525587383328,
"grad_norm": 0.10089211561220655,
"learning_rate": 4.5444301352221504e-07,
"logits/chosen": -1.073828101158142,
"logits/rejected": -1.073632836341858,
"logps/chosen": -457.9750061035156,
"logps/rejected": -594.4000244140625,
"loss": 0.0132,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.7056884765625,
"rewards/margins": 15.8515625,
"rewards/rejected": -20.556249618530273,
"step": 3390
},
{
"epoch": 2.1879626649501125,
"grad_norm": 0.0006958724241457409,
"learning_rate": 4.528332260141661e-07,
"logits/chosen": -1.022985816001892,
"logits/rejected": -1.043212890625,
"logps/chosen": -411.5,
"logps/rejected": -548.3250122070312,
"loss": 0.0101,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.134961128234863,
"rewards/margins": 16.254688262939453,
"rewards/rejected": -20.389062881469727,
"step": 3400
},
{
"epoch": 2.1943997425168975,
"grad_norm": 14.135716304337999,
"learning_rate": 4.512234385061172e-07,
"logits/chosen": -0.994384765625,
"logits/rejected": -1.0382568836212158,
"logps/chosen": -464.2250061035156,
"logps/rejected": -574.7000122070312,
"loss": 0.0188,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.747363090515137,
"rewards/margins": 16.634374618530273,
"rewards/rejected": -21.364063262939453,
"step": 3410
},
{
"epoch": 2.200836820083682,
"grad_norm": 0.31310709472957954,
"learning_rate": 4.4961365099806826e-07,
"logits/chosen": -1.076269507408142,
"logits/rejected": -1.083398461341858,
"logps/chosen": -407.2250061035156,
"logps/rejected": -520.4500122070312,
"loss": 0.0011,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.8101563453674316,
"rewards/margins": 17.2265625,
"rewards/rejected": -21.035938262939453,
"step": 3420
},
{
"epoch": 2.2072738976504667,
"grad_norm": 0.008193914417783646,
"learning_rate": 4.480038634900193e-07,
"logits/chosen": -0.981396496295929,
"logits/rejected": -0.9964355230331421,
"logps/chosen": -392.75,
"logps/rejected": -537.625,
"loss": 0.0184,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.210669040679932,
"rewards/margins": 16.301563262939453,
"rewards/rejected": -20.514842987060547,
"step": 3430
},
{
"epoch": 2.2137109752172512,
"grad_norm": 0.5881690669947562,
"learning_rate": 4.4639407598197035e-07,
"logits/chosen": -1.028222680091858,
"logits/rejected": -1.021386742591858,
"logps/chosen": -438.875,
"logps/rejected": -579.25,
"loss": 0.0069,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.130139350891113,
"rewards/margins": 16.584375381469727,
"rewards/rejected": -20.701562881469727,
"step": 3440
},
{
"epoch": 2.220148052784036,
"grad_norm": 1.8005519369536847,
"learning_rate": 4.447842884739214e-07,
"logits/chosen": -0.9946044683456421,
"logits/rejected": -1.0242187976837158,
"logps/chosen": -400.92498779296875,
"logps/rejected": -537.0499877929688,
"loss": 0.0187,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.555712699890137,
"rewards/margins": 16.268749237060547,
"rewards/rejected": -20.821874618530273,
"step": 3450
},
{
"epoch": 2.226585130350821,
"grad_norm": 0.03380963376951087,
"learning_rate": 4.431745009658725e-07,
"logits/chosen": -0.999707043170929,
"logits/rejected": -1.041748046875,
"logps/chosen": -408.6000061035156,
"logps/rejected": -551.0750122070312,
"loss": 0.0045,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.134863376617432,
"rewards/margins": 16.989063262939453,
"rewards/rejected": -21.118749618530273,
"step": 3460
},
{
"epoch": 2.2330222079176054,
"grad_norm": 0.033513908815007994,
"learning_rate": 4.415647134578235e-07,
"logits/chosen": -1.010839819908142,
"logits/rejected": -1.040429711341858,
"logps/chosen": -424.95001220703125,
"logps/rejected": -571.0,
"loss": 0.0094,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.512225151062012,
"rewards/margins": 17.228124618530273,
"rewards/rejected": -21.732812881469727,
"step": 3470
},
{
"epoch": 2.23945928548439,
"grad_norm": 0.2740000677105209,
"learning_rate": 4.3995492594977465e-07,
"logits/chosen": -0.97900390625,
"logits/rejected": -0.9859619140625,
"logps/chosen": -396.0249938964844,
"logps/rejected": -535.1749877929688,
"loss": 0.0206,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.21337890625,
"rewards/margins": 15.759374618530273,
"rewards/rejected": -20.957813262939453,
"step": 3480
},
{
"epoch": 2.2458963630511746,
"grad_norm": 0.15223632079148156,
"learning_rate": 4.3834513844172567e-07,
"logits/chosen": -1.014062523841858,
"logits/rejected": -1.0511353015899658,
"logps/chosen": -442.7250061035156,
"logps/rejected": -571.4749755859375,
"loss": 0.0295,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.354589939117432,
"rewards/margins": 15.748437881469727,
"rewards/rejected": -21.092187881469727,
"step": 3490
},
{
"epoch": 2.2523334406179596,
"grad_norm": 0.13728561648140786,
"learning_rate": 4.3673535093367674e-07,
"logits/chosen": -1.0329101085662842,
"logits/rejected": -1.036962866783142,
"logps/chosen": -382.4750061035156,
"logps/rejected": -534.5,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.963476657867432,
"rewards/margins": 16.146875381469727,
"rewards/rejected": -22.104686737060547,
"step": 3500
},
{
"epoch": 2.258770518184744,
"grad_norm": 10.709637400608113,
"learning_rate": 4.3512556342562776e-07,
"logits/chosen": -1.0541503429412842,
"logits/rejected": -1.050878882408142,
"logps/chosen": -443.9375,
"logps/rejected": -584.8499755859375,
"loss": 0.017,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.727734565734863,
"rewards/margins": 17.151561737060547,
"rewards/rejected": -22.8671875,
"step": 3510
},
{
"epoch": 2.2652075957515287,
"grad_norm": 0.7174296831368239,
"learning_rate": 4.335157759175789e-07,
"logits/chosen": -1.0232422351837158,
"logits/rejected": -1.032568335533142,
"logps/chosen": -406.875,
"logps/rejected": -583.6500244140625,
"loss": 0.0365,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.3134765625,
"rewards/margins": 17.565624237060547,
"rewards/rejected": -22.865625381469727,
"step": 3520
},
{
"epoch": 2.2716446733183133,
"grad_norm": 0.6260293290211867,
"learning_rate": 4.319059884095299e-07,
"logits/chosen": -1.082421898841858,
"logits/rejected": -1.1144530773162842,
"logps/chosen": -413.70001220703125,
"logps/rejected": -555.6500244140625,
"loss": 0.0217,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.38232421875,
"rewards/margins": 16.2734375,
"rewards/rejected": -21.674999237060547,
"step": 3530
},
{
"epoch": 2.2780817508850983,
"grad_norm": 1.703213885575144,
"learning_rate": 4.30296200901481e-07,
"logits/chosen": -0.9996337890625,
"logits/rejected": -1.014892578125,
"logps/chosen": -439.04998779296875,
"logps/rejected": -576.0750122070312,
"loss": 0.0138,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.720019340515137,
"rewards/margins": 16.753124237060547,
"rewards/rejected": -21.4765625,
"step": 3540
},
{
"epoch": 2.284518828451883,
"grad_norm": 2.632339736606739,
"learning_rate": 4.2868641339343205e-07,
"logits/chosen": -1.0037109851837158,
"logits/rejected": -1.0343017578125,
"logps/chosen": -425.125,
"logps/rejected": -536.75,
"loss": 0.0159,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.025781154632568,
"rewards/margins": 16.020313262939453,
"rewards/rejected": -20.042186737060547,
"step": 3550
},
{
"epoch": 2.2909559060186675,
"grad_norm": 0.20391483750374004,
"learning_rate": 4.2707662588538313e-07,
"logits/chosen": -1.028173804283142,
"logits/rejected": -1.041967749595642,
"logps/chosen": -420.92498779296875,
"logps/rejected": -558.2000122070312,
"loss": 0.0198,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.070458889007568,
"rewards/margins": 15.535937309265137,
"rewards/rejected": -19.610937118530273,
"step": 3560
},
{
"epoch": 2.297392983585452,
"grad_norm": 0.22150018868741062,
"learning_rate": 4.2546683837733415e-07,
"logits/chosen": -1.0495116710662842,
"logits/rejected": -1.0852539539337158,
"logps/chosen": -424.1499938964844,
"logps/rejected": -548.6500244140625,
"loss": 0.0221,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.4621949195861816,
"rewards/margins": 16.325000762939453,
"rewards/rejected": -19.792186737060547,
"step": 3570
},
{
"epoch": 2.3038300611522367,
"grad_norm": 0.09769741421519501,
"learning_rate": 4.238570508692853e-07,
"logits/chosen": -1.0507323741912842,
"logits/rejected": -1.040673851966858,
"logps/chosen": -417.2749938964844,
"logps/rejected": -568.0499877929688,
"loss": 0.0132,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.569872856140137,
"rewards/margins": 16.069530487060547,
"rewards/rejected": -20.625,
"step": 3580
},
{
"epoch": 2.3102671387190217,
"grad_norm": 0.3834551065281765,
"learning_rate": 4.222472633612363e-07,
"logits/chosen": -1.0048736333847046,
"logits/rejected": -1.031103491783142,
"logps/chosen": -425.29998779296875,
"logps/rejected": -565.8499755859375,
"loss": 0.0092,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.7234864234924316,
"rewards/margins": 16.870311737060547,
"rewards/rejected": -20.598438262939453,
"step": 3590
},
{
"epoch": 2.3167042162858063,
"grad_norm": 1.9144721824557707,
"learning_rate": 4.2063747585318737e-07,
"logits/chosen": -1.0072753429412842,
"logits/rejected": -1.0269043445587158,
"logps/chosen": -381.07501220703125,
"logps/rejected": -536.6500244140625,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.131249904632568,
"rewards/margins": 16.9375,
"rewards/rejected": -21.082813262939453,
"step": 3600
},
{
"epoch": 2.323141293852591,
"grad_norm": 36.214552892647944,
"learning_rate": 4.190276883451384e-07,
"logits/chosen": -1.02734375,
"logits/rejected": -1.035888671875,
"logps/chosen": -441.3374938964844,
"logps/rejected": -592.0499877929688,
"loss": 0.0068,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.705712795257568,
"rewards/margins": 17.370311737060547,
"rewards/rejected": -22.082813262939453,
"step": 3610
},
{
"epoch": 2.329578371419376,
"grad_norm": 0.047373315431620606,
"learning_rate": 4.174179008370895e-07,
"logits/chosen": -1.1228516101837158,
"logits/rejected": -1.125585913658142,
"logps/chosen": -416.7749938964844,
"logps/rejected": -573.9000244140625,
"loss": 0.0159,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.840966701507568,
"rewards/margins": 16.671875,
"rewards/rejected": -21.510936737060547,
"step": 3620
},
{
"epoch": 2.3360154489861604,
"grad_norm": 0.5143692709122827,
"learning_rate": 4.1580811332904054e-07,
"logits/chosen": -1.047265648841858,
"logits/rejected": -1.072656273841858,
"logps/chosen": -401.3999938964844,
"logps/rejected": -503.2250061035156,
"loss": 0.0226,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.970654487609863,
"rewards/margins": 15.118749618530273,
"rewards/rejected": -20.075000762939453,
"step": 3630
},
{
"epoch": 2.342452526552945,
"grad_norm": 0.13432767152874814,
"learning_rate": 4.141983258209916e-07,
"logits/chosen": -1.0247802734375,
"logits/rejected": -1.006445288658142,
"logps/chosen": -397.3125,
"logps/rejected": -522.9000244140625,
"loss": 0.0371,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -3.4481444358825684,
"rewards/margins": 15.620312690734863,
"rewards/rejected": -19.079687118530273,
"step": 3640
},
{
"epoch": 2.3488896041197296,
"grad_norm": 0.34195251874543514,
"learning_rate": 4.125885383129427e-07,
"logits/chosen": -0.9477783441543579,
"logits/rejected": -0.9656982421875,
"logps/chosen": -404.51251220703125,
"logps/rejected": -527.25,
"loss": 0.0182,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.066552639007568,
"rewards/margins": 15.949999809265137,
"rewards/rejected": -20.014062881469727,
"step": 3650
},
{
"epoch": 2.355326681686514,
"grad_norm": 2.526519532504119,
"learning_rate": 4.1097875080489376e-07,
"logits/chosen": -1.093359351158142,
"logits/rejected": -1.110498070716858,
"logps/chosen": -408.98748779296875,
"logps/rejected": -553.0499877929688,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.961523532867432,
"rewards/margins": 16.207813262939453,
"rewards/rejected": -21.168750762939453,
"step": 3660
},
{
"epoch": 2.361763759253299,
"grad_norm": 0.06085996531440162,
"learning_rate": 4.093689632968448e-07,
"logits/chosen": -1.125634789466858,
"logits/rejected": -1.1251952648162842,
"logps/chosen": -434.2250061035156,
"logps/rejected": -596.0499877929688,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.989697456359863,
"rewards/margins": 17.685937881469727,
"rewards/rejected": -22.674999237060547,
"step": 3670
},
{
"epoch": 2.3682008368200838,
"grad_norm": 1.0978779971202857,
"learning_rate": 4.0775917578879585e-07,
"logits/chosen": -1.00048828125,
"logits/rejected": -1.0075194835662842,
"logps/chosen": -383.17498779296875,
"logps/rejected": -517.9500122070312,
"loss": 0.0307,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -4.374267578125,
"rewards/margins": 15.589062690734863,
"rewards/rejected": -19.954687118530273,
"step": 3680
},
{
"epoch": 2.3746379143868683,
"grad_norm": 0.004285537440066397,
"learning_rate": 4.061493882807469e-07,
"logits/chosen": -0.9914916753768921,
"logits/rejected": -1.009521484375,
"logps/chosen": -420.8374938964844,
"logps/rejected": -559.1500244140625,
"loss": 0.0128,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.005566596984863,
"rewards/margins": 17.623437881469727,
"rewards/rejected": -22.639062881469727,
"step": 3690
},
{
"epoch": 2.381074991953653,
"grad_norm": 0.0753736597073573,
"learning_rate": 4.04539600772698e-07,
"logits/chosen": -0.992919921875,
"logits/rejected": -1.01214599609375,
"logps/chosen": -429.8500061035156,
"logps/rejected": -572.2000122070312,
"loss": 0.0165,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.004248142242432,
"rewards/margins": 17.706249237060547,
"rewards/rejected": -21.701562881469727,
"step": 3700
},
{
"epoch": 2.3875120695204375,
"grad_norm": 12.902251613669751,
"learning_rate": 4.02929813264649e-07,
"logits/chosen": -1.042822241783142,
"logits/rejected": -1.052832007408142,
"logps/chosen": -420.6000061035156,
"logps/rejected": -559.1500244140625,
"loss": 0.0239,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.941210746765137,
"rewards/margins": 15.0078125,
"rewards/rejected": -20.9375,
"step": 3710
},
{
"epoch": 2.3939491470872225,
"grad_norm": 4.529963145208864,
"learning_rate": 4.0132002575660014e-07,
"logits/chosen": -0.9861816167831421,
"logits/rejected": -1.039648413658142,
"logps/chosen": -417.32501220703125,
"logps/rejected": -582.5499877929688,
"loss": 0.0046,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.405077934265137,
"rewards/margins": 17.334375381469727,
"rewards/rejected": -21.7265625,
"step": 3720
},
{
"epoch": 2.400386224654007,
"grad_norm": 0.9629898122683673,
"learning_rate": 3.9971023824855116e-07,
"logits/chosen": -1.044580101966858,
"logits/rejected": -1.0702636241912842,
"logps/chosen": -394.17498779296875,
"logps/rejected": -539.5999755859375,
"loss": 0.0088,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.7095704078674316,
"rewards/margins": 17.260936737060547,
"rewards/rejected": -20.965625762939453,
"step": 3730
},
{
"epoch": 2.4068233022207917,
"grad_norm": 0.20698119594926714,
"learning_rate": 3.9810045074050224e-07,
"logits/chosen": -1.0583007335662842,
"logits/rejected": -1.0828125476837158,
"logps/chosen": -473.20001220703125,
"logps/rejected": -547.3499755859375,
"loss": 0.0101,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.494311571121216,
"rewards/margins": 16.2109375,
"rewards/rejected": -19.709375381469727,
"step": 3740
},
{
"epoch": 2.4132603797875767,
"grad_norm": 0.013493617041070298,
"learning_rate": 3.9649066323245326e-07,
"logits/chosen": -0.940869152545929,
"logits/rejected": -0.9414306879043579,
"logps/chosen": -391.5,
"logps/rejected": -520.6749877929688,
"loss": 0.0205,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.1650633811950684,
"rewards/margins": 16.353124618530273,
"rewards/rejected": -19.526561737060547,
"step": 3750
},
{
"epoch": 2.4196974573543613,
"grad_norm": 0.013139894005101382,
"learning_rate": 3.948808757244044e-07,
"logits/chosen": -0.9778076410293579,
"logits/rejected": -0.998120129108429,
"logps/chosen": -427.25,
"logps/rejected": -550.0499877929688,
"loss": 0.0311,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.592041015625,
"rewards/margins": 15.556249618530273,
"rewards/rejected": -19.140625,
"step": 3760
},
{
"epoch": 2.426134534921146,
"grad_norm": 7.327332077965629,
"learning_rate": 3.932710882163554e-07,
"logits/chosen": -1.0476562976837158,
"logits/rejected": -1.07373046875,
"logps/chosen": -432.92498779296875,
"logps/rejected": -563.9500122070312,
"loss": 0.0118,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.391796827316284,
"rewards/margins": 17.470312118530273,
"rewards/rejected": -20.870311737060547,
"step": 3770
},
{
"epoch": 2.4325716124879304,
"grad_norm": 0.1810775822374288,
"learning_rate": 3.916613007083065e-07,
"logits/chosen": -1.052490234375,
"logits/rejected": -1.092626929283142,
"logps/chosen": -379.625,
"logps/rejected": -523.9500122070312,
"loss": 0.0189,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.958789110183716,
"rewards/margins": 16.422657012939453,
"rewards/rejected": -20.373437881469727,
"step": 3780
},
{
"epoch": 2.439008690054715,
"grad_norm": 0.23327394750489913,
"learning_rate": 3.9005151320025755e-07,
"logits/chosen": -1.0048339366912842,
"logits/rejected": -1.0261719226837158,
"logps/chosen": -396.11248779296875,
"logps/rejected": -539.2000122070312,
"loss": 0.0096,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.868115186691284,
"rewards/margins": 16.415624618530273,
"rewards/rejected": -20.299999237060547,
"step": 3790
},
{
"epoch": 2.4454457676215,
"grad_norm": 0.02558078884725733,
"learning_rate": 3.884417256922086e-07,
"logits/chosen": -0.972582995891571,
"logits/rejected": -0.9895995855331421,
"logps/chosen": -400.0249938964844,
"logps/rejected": -556.4000244140625,
"loss": 0.0014,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.6697998046875,
"rewards/margins": 16.653125762939453,
"rewards/rejected": -20.310937881469727,
"step": 3800
},
{
"epoch": 2.4518828451882846,
"grad_norm": 0.05959869141952533,
"learning_rate": 3.8683193818415965e-07,
"logits/chosen": -0.9869140386581421,
"logits/rejected": -0.977246105670929,
"logps/chosen": -407.04998779296875,
"logps/rejected": -573.4000244140625,
"loss": 0.0133,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.500256538391113,
"rewards/margins": 15.440625190734863,
"rewards/rejected": -19.932811737060547,
"step": 3810
},
{
"epoch": 2.458319922755069,
"grad_norm": 0.08842132782631504,
"learning_rate": 3.8522215067611077e-07,
"logits/chosen": -1.037939429283142,
"logits/rejected": -1.053808569908142,
"logps/chosen": -423.07501220703125,
"logps/rejected": -584.8499755859375,
"loss": 0.0145,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.993945121765137,
"rewards/margins": 17.1484375,
"rewards/rejected": -22.149999618530273,
"step": 3820
},
{
"epoch": 2.4647570003218537,
"grad_norm": 30.947385597831875,
"learning_rate": 3.836123631680618e-07,
"logits/chosen": -1.028906226158142,
"logits/rejected": -1.0302002429962158,
"logps/chosen": -372.0,
"logps/rejected": -546.8250122070312,
"loss": 0.0212,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.22998046875,
"rewards/margins": 16.628124237060547,
"rewards/rejected": -20.865625381469727,
"step": 3830
},
{
"epoch": 2.4711940778886383,
"grad_norm": 0.05211605695940069,
"learning_rate": 3.8200257566001287e-07,
"logits/chosen": -1.055566430091858,
"logits/rejected": -1.0647461414337158,
"logps/chosen": -409.04998779296875,
"logps/rejected": -544.0499877929688,
"loss": 0.0048,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.8119139671325684,
"rewards/margins": 18.073436737060547,
"rewards/rejected": -21.878124237060547,
"step": 3840
},
{
"epoch": 2.4776311554554233,
"grad_norm": 9.213720198102742,
"learning_rate": 3.803927881519639e-07,
"logits/chosen": -1.0117919445037842,
"logits/rejected": -1.0427124500274658,
"logps/chosen": -433.5249938964844,
"logps/rejected": -587.8499755859375,
"loss": 0.0304,
"rewards/accuracies": 0.96875,
"rewards/chosen": -4.554394721984863,
"rewards/margins": 16.564062118530273,
"rewards/rejected": -21.112499237060547,
"step": 3850
},
{
"epoch": 2.484068233022208,
"grad_norm": 0.24431172158453063,
"learning_rate": 3.78783000643915e-07,
"logits/chosen": -1.0658690929412842,
"logits/rejected": -1.073632836341858,
"logps/chosen": -367.375,
"logps/rejected": -512.0999755859375,
"loss": 0.0288,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -3.274951219558716,
"rewards/margins": 15.74609375,
"rewards/rejected": -19.03125,
"step": 3860
},
{
"epoch": 2.4905053105889925,
"grad_norm": 71.25388858956305,
"learning_rate": 3.7717321313586603e-07,
"logits/chosen": -1.061425805091858,
"logits/rejected": -1.0839354991912842,
"logps/chosen": -455.8374938964844,
"logps/rejected": -562.2000122070312,
"loss": 0.0104,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.843505859375,
"rewards/margins": 16.064062118530273,
"rewards/rejected": -20.912500381469727,
"step": 3870
},
{
"epoch": 2.4969423881557775,
"grad_norm": 1.8350700859136448,
"learning_rate": 3.755634256278171e-07,
"logits/chosen": -0.9950927495956421,
"logits/rejected": -1.032861351966858,
"logps/chosen": -421.9750061035156,
"logps/rejected": -555.4000244140625,
"loss": 0.0139,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.4852051734924316,
"rewards/margins": 16.821874618530273,
"rewards/rejected": -20.3125,
"step": 3880
},
{
"epoch": 2.503379465722562,
"grad_norm": 5.050750304416249,
"learning_rate": 3.739536381197682e-07,
"logits/chosen": -1.1130859851837158,
"logits/rejected": -1.1386229991912842,
"logps/chosen": -406.8500061035156,
"logps/rejected": -538.0499877929688,
"loss": 0.0127,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.451952934265137,
"rewards/margins": 16.712499618530273,
"rewards/rejected": -22.167186737060547,
"step": 3890
},
{
"epoch": 2.5098165432893467,
"grad_norm": 5.355053391341112,
"learning_rate": 3.7234385061171925e-07,
"logits/chosen": -0.9847412109375,
"logits/rejected": -1.0299804210662842,
"logps/chosen": -412.7250061035156,
"logps/rejected": -550.6500244140625,
"loss": 0.017,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.985693454742432,
"rewards/margins": 18.120311737060547,
"rewards/rejected": -23.103124618530273,
"step": 3900
},
{
"epoch": 2.5162536208561312,
"grad_norm": 0.0193165295031974,
"learning_rate": 3.707340631036703e-07,
"logits/chosen": -1.0419189929962158,
"logits/rejected": -1.063818335533142,
"logps/chosen": -406.9624938964844,
"logps/rejected": -541.1500244140625,
"loss": 0.0132,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.443945407867432,
"rewards/margins": 17.647655487060547,
"rewards/rejected": -23.082813262939453,
"step": 3910
},
{
"epoch": 2.522690698422916,
"grad_norm": 1.277209930482019,
"learning_rate": 3.6912427559562135e-07,
"logits/chosen": -1.0840332508087158,
"logits/rejected": -1.095361351966858,
"logps/chosen": -430.375,
"logps/rejected": -571.4000244140625,
"loss": 0.0064,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.085156440734863,
"rewards/margins": 16.314062118530273,
"rewards/rejected": -21.404687881469727,
"step": 3920
},
{
"epoch": 2.529127775989701,
"grad_norm": 14.484108215530707,
"learning_rate": 3.675144880875724e-07,
"logits/chosen": -1.103124976158142,
"logits/rejected": -1.1331055164337158,
"logps/chosen": -451.17498779296875,
"logps/rejected": -567.4000244140625,
"loss": 0.0092,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.98681640625,
"rewards/margins": 17.245311737060547,
"rewards/rejected": -22.225000381469727,
"step": 3930
},
{
"epoch": 2.5355648535564854,
"grad_norm": 0.08431049236655122,
"learning_rate": 3.659047005795235e-07,
"logits/chosen": -1.0732421875,
"logits/rejected": -1.0867431163787842,
"logps/chosen": -447.67498779296875,
"logps/rejected": -586.1500244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.617505073547363,
"rewards/margins": 17.545312881469727,
"rewards/rejected": -22.178125381469727,
"step": 3940
},
{
"epoch": 2.54200193112327,
"grad_norm": 0.001819636969881986,
"learning_rate": 3.642949130714745e-07,
"logits/chosen": -1.0378296375274658,
"logits/rejected": -1.06689453125,
"logps/chosen": -378.20001220703125,
"logps/rejected": -521.8499755859375,
"loss": 0.0131,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.829297065734863,
"rewards/margins": 16.543750762939453,
"rewards/rejected": -21.359375,
"step": 3950
},
{
"epoch": 2.5484390086900546,
"grad_norm": 9.099365929589844,
"learning_rate": 3.6268512556342564e-07,
"logits/chosen": -1.011962890625,
"logits/rejected": -1.035668969154358,
"logps/chosen": -410.3500061035156,
"logps/rejected": -571.75,
"loss": 0.0182,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.998046875,
"rewards/margins": 17.016407012939453,
"rewards/rejected": -22.017187118530273,
"step": 3960
},
{
"epoch": 2.554876086256839,
"grad_norm": 0.0459123345549701,
"learning_rate": 3.6107533805537666e-07,
"logits/chosen": -1.1208984851837158,
"logits/rejected": -1.1435546875,
"logps/chosen": -439.8999938964844,
"logps/rejected": -591.9500122070312,
"loss": 0.0131,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.621191501617432,
"rewards/margins": 18.442188262939453,
"rewards/rejected": -23.067188262939453,
"step": 3970
},
{
"epoch": 2.561313163823624,
"grad_norm": 1.9349974401487566,
"learning_rate": 3.5946555054732774e-07,
"logits/chosen": -1.0195801258087158,
"logits/rejected": -1.0270507335662842,
"logps/chosen": -426.95001220703125,
"logps/rejected": -560.0,
"loss": 0.0157,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.405713081359863,
"rewards/margins": 17.421875,
"rewards/rejected": -22.818750381469727,
"step": 3980
},
{
"epoch": 2.5677502413904087,
"grad_norm": 0.4891014195678684,
"learning_rate": 3.5785576303927876e-07,
"logits/chosen": -1.0330078601837158,
"logits/rejected": -1.0408203601837158,
"logps/chosen": -429.7749938964844,
"logps/rejected": -601.8499755859375,
"loss": 0.0099,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.31982421875,
"rewards/margins": 17.131250381469727,
"rewards/rejected": -22.443750381469727,
"step": 3990
},
{
"epoch": 2.5741873189571933,
"grad_norm": 1.5627512684455094,
"learning_rate": 3.562459755312299e-07,
"logits/chosen": -1.0496826171875,
"logits/rejected": -1.080175757408142,
"logps/chosen": -415.54998779296875,
"logps/rejected": -572.1500244140625,
"loss": 0.0004,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.251953125,
"rewards/margins": 17.899999618530273,
"rewards/rejected": -23.146875381469727,
"step": 4000
},
{
"epoch": 2.5806243965239783,
"grad_norm": 0.08739818731065581,
"learning_rate": 3.546361880231809e-07,
"logits/chosen": -1.082617163658142,
"logits/rejected": -1.087744116783142,
"logps/chosen": -473.4750061035156,
"logps/rejected": -611.75,
"loss": 0.0101,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.598681449890137,
"rewards/margins": 17.556249618530273,
"rewards/rejected": -24.149999618530273,
"step": 4010
},
{
"epoch": 2.587061474090763,
"grad_norm": 0.3471564851888695,
"learning_rate": 3.53026400515132e-07,
"logits/chosen": -1.062597632408142,
"logits/rejected": -1.064550757408142,
"logps/chosen": -414.20001220703125,
"logps/rejected": -553.9000244140625,
"loss": 0.0095,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.682898044586182,
"rewards/margins": 16.796875,
"rewards/rejected": -22.484375,
"step": 4020
},
{
"epoch": 2.5934985516575475,
"grad_norm": 0.014063778025355996,
"learning_rate": 3.5141661300708305e-07,
"logits/chosen": -1.0272216796875,
"logits/rejected": -1.03466796875,
"logps/chosen": -370.1875,
"logps/rejected": -538.1500244140625,
"loss": 0.0206,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.160009860992432,
"rewards/margins": 17.0546875,
"rewards/rejected": -21.209375381469727,
"step": 4030
},
{
"epoch": 2.599935629224332,
"grad_norm": 192.87824451729486,
"learning_rate": 3.498068254990341e-07,
"logits/chosen": -1.0537598133087158,
"logits/rejected": -1.0952637195587158,
"logps/chosen": -421.1499938964844,
"logps/rejected": -559.3499755859375,
"loss": 0.0109,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.37060546875,
"rewards/margins": 16.501562118530273,
"rewards/rejected": -20.875,
"step": 4040
},
{
"epoch": 2.6063727067911167,
"grad_norm": 0.08960042129229139,
"learning_rate": 3.4819703799098514e-07,
"logits/chosen": -1.115136742591858,
"logits/rejected": -1.1196777820587158,
"logps/chosen": -430.95001220703125,
"logps/rejected": -589.5999755859375,
"loss": 0.0109,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.207763671875,
"rewards/margins": 16.924999237060547,
"rewards/rejected": -22.129688262939453,
"step": 4050
},
{
"epoch": 2.6128097843579017,
"grad_norm": 0.20842717683750414,
"learning_rate": 3.4658725048293627e-07,
"logits/chosen": -1.0168945789337158,
"logits/rejected": -1.046289086341858,
"logps/chosen": -443.2250061035156,
"logps/rejected": -565.0999755859375,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.522119045257568,
"rewards/margins": 16.446874618530273,
"rewards/rejected": -20.96875,
"step": 4060
},
{
"epoch": 2.6192468619246863,
"grad_norm": 0.25064627796735495,
"learning_rate": 3.449774629748873e-07,
"logits/chosen": -1.0129883289337158,
"logits/rejected": -1.024804711341858,
"logps/chosen": -379.375,
"logps/rejected": -528.3499755859375,
"loss": 0.0263,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -3.7671875953674316,
"rewards/margins": 16.249217987060547,
"rewards/rejected": -20.014062881469727,
"step": 4070
},
{
"epoch": 2.625683939491471,
"grad_norm": 0.08946523961309825,
"learning_rate": 3.4336767546683836e-07,
"logits/chosen": -1.0355956554412842,
"logits/rejected": -1.0556151866912842,
"logps/chosen": -433.6499938964844,
"logps/rejected": -589.7000122070312,
"loss": 0.0141,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.182519435882568,
"rewards/margins": 15.75,
"rewards/rejected": -20.9296875,
"step": 4080
},
{
"epoch": 2.6321210170582554,
"grad_norm": 0.009005467084888181,
"learning_rate": 3.417578879587894e-07,
"logits/chosen": -1.0455322265625,
"logits/rejected": -1.050805687904358,
"logps/chosen": -472.875,
"logps/rejected": -595.9500122070312,
"loss": 0.0027,
"rewards/accuracies": 1.0,
"rewards/chosen": -4.389208793640137,
"rewards/margins": 17.415624618530273,
"rewards/rejected": -21.810937881469727,
"step": 4090
},
{
"epoch": 2.63855809462504,
"grad_norm": 0.03113362210332774,
"learning_rate": 3.401481004507405e-07,
"logits/chosen": -1.061279296875,
"logits/rejected": -1.085205078125,
"logps/chosen": -399.92498779296875,
"logps/rejected": -553.8499755859375,
"loss": 0.0112,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.193945407867432,
"rewards/margins": 16.964061737060547,
"rewards/rejected": -21.159374237060547,
"step": 4100
},
{
"epoch": 2.644995172191825,
"grad_norm": 0.37326898026603983,
"learning_rate": 3.3853831294269153e-07,
"logits/chosen": -1.027929663658142,
"logits/rejected": -1.041015625,
"logps/chosen": -418.70001220703125,
"logps/rejected": -548.0,
"loss": 0.0094,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.916943550109863,
"rewards/margins": 16.417186737060547,
"rewards/rejected": -21.334375381469727,
"step": 4110
},
{
"epoch": 2.6514322497586096,
"grad_norm": 7.897992961962735,
"learning_rate": 3.369285254346426e-07,
"logits/chosen": -0.9991455078125,
"logits/rejected": -1.0133056640625,
"logps/chosen": -395.0249938964844,
"logps/rejected": -551.0499877929688,
"loss": 0.0139,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.975878953933716,
"rewards/margins": 17.159374237060547,
"rewards/rejected": -21.131250381469727,
"step": 4120
},
{
"epoch": 2.657869327325394,
"grad_norm": 0.07509522718083096,
"learning_rate": 3.353187379265937e-07,
"logits/chosen": -1.073095679283142,
"logits/rejected": -1.070459008216858,
"logps/chosen": -396.95001220703125,
"logps/rejected": -549.5,
"loss": 0.0196,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.819872856140137,
"rewards/margins": 17.485937118530273,
"rewards/rejected": -22.306249618530273,
"step": 4130
},
{
"epoch": 2.664306404892179,
"grad_norm": 0.5200990215076599,
"learning_rate": 3.3370895041854475e-07,
"logits/chosen": -1.039453148841858,
"logits/rejected": -1.0915038585662842,
"logps/chosen": -453.75,
"logps/rejected": -574.2999877929688,
"loss": 0.0225,
"rewards/accuracies": 0.96875,
"rewards/chosen": -4.282422065734863,
"rewards/margins": 15.921875,
"rewards/rejected": -20.217187881469727,
"step": 4140
},
{
"epoch": 2.6707434824589638,
"grad_norm": 0.25225569399148123,
"learning_rate": 3.3209916291049577e-07,
"logits/chosen": -1.0086181163787842,
"logits/rejected": -1.0000488758087158,
"logps/chosen": -372.42498779296875,
"logps/rejected": -509.29998779296875,
"loss": 0.0469,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -4.168701171875,
"rewards/margins": 14.98828125,
"rewards/rejected": -19.173437118530273,
"step": 4150
},
{
"epoch": 2.6771805600257483,
"grad_norm": 0.08673995336101631,
"learning_rate": 3.3048937540244685e-07,
"logits/chosen": -1.0426757335662842,
"logits/rejected": -1.098046898841858,
"logps/chosen": -460.25,
"logps/rejected": -575.3499755859375,
"loss": 0.0059,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.84619140625,
"rewards/margins": 16.293750762939453,
"rewards/rejected": -20.1328125,
"step": 4160
},
{
"epoch": 2.683617637592533,
"grad_norm": 13.353206676041454,
"learning_rate": 3.288795878943979e-07,
"logits/chosen": -1.021875023841858,
"logits/rejected": -1.0466797351837158,
"logps/chosen": -418.9375,
"logps/rejected": -592.9000244140625,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -3.449902296066284,
"rewards/margins": 17.214061737060547,
"rewards/rejected": -20.654687881469727,
"step": 4170
},
{
"epoch": 2.6900547151593175,
"grad_norm": 0.09935680046220585,
"learning_rate": 3.27269800386349e-07,
"logits/chosen": -0.990771472454071,
"logits/rejected": -1.0391356945037842,
"logps/chosen": -396.1499938964844,
"logps/rejected": -495.29998779296875,
"loss": 0.0223,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.1318116188049316,
"rewards/margins": 15.576562881469727,
"rewards/rejected": -18.704687118530273,
"step": 4180
},
{
"epoch": 2.6964917927261025,
"grad_norm": 2.336769551114649,
"learning_rate": 3.256600128783e-07,
"logits/chosen": -1.0742676258087158,
"logits/rejected": -1.09033203125,
"logps/chosen": -416.04998779296875,
"logps/rejected": -533.1749877929688,
"loss": 0.0215,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.793750047683716,
"rewards/margins": 14.542187690734863,
"rewards/rejected": -18.3359375,
"step": 4190
},
{
"epoch": 2.702928870292887,
"grad_norm": 1.6019642715844329,
"learning_rate": 3.2405022537025114e-07,
"logits/chosen": -1.0363037586212158,
"logits/rejected": -1.076416015625,
"logps/chosen": -403.375,
"logps/rejected": -547.3499755859375,
"loss": 0.011,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.212695360183716,
"rewards/margins": 15.584375381469727,
"rewards/rejected": -18.792186737060547,
"step": 4200
},
{
"epoch": 2.7093659478596717,
"grad_norm": 2.140234939910703,
"learning_rate": 3.2244043786220216e-07,
"logits/chosen": -1.002539038658142,
"logits/rejected": -1.024999976158142,
"logps/chosen": -464.86248779296875,
"logps/rejected": -558.5,
"loss": 0.0084,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -2.7227540016174316,
"rewards/margins": 14.568750381469727,
"rewards/rejected": -17.287500381469727,
"step": 4210
},
{
"epoch": 2.7158030254264562,
"grad_norm": 11.833136190216157,
"learning_rate": 3.2083065035415323e-07,
"logits/chosen": -0.994433581829071,
"logits/rejected": -1.042333960533142,
"logps/chosen": -406.4624938964844,
"logps/rejected": -500.2749938964844,
"loss": 0.0137,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.553906202316284,
"rewards/margins": 15.292187690734863,
"rewards/rejected": -17.853124618530273,
"step": 4220
},
{
"epoch": 2.722240102993241,
"grad_norm": 0.20643996913297855,
"learning_rate": 3.1922086284610425e-07,
"logits/chosen": -0.989501953125,
"logits/rejected": -1.02734375,
"logps/chosen": -407.3500061035156,
"logps/rejected": -531.7000122070312,
"loss": 0.0192,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.6068358421325684,
"rewards/margins": 14.211718559265137,
"rewards/rejected": -17.814062118530273,
"step": 4230
},
{
"epoch": 2.728677180560026,
"grad_norm": 0.05435070454747595,
"learning_rate": 3.176110753380554e-07,
"logits/chosen": -0.961718738079071,
"logits/rejected": -0.965283215045929,
"logps/chosen": -399.92498779296875,
"logps/rejected": -552.5,
"loss": 0.014,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.569287061691284,
"rewards/margins": 16.609375,
"rewards/rejected": -20.1796875,
"step": 4240
},
{
"epoch": 2.7351142581268104,
"grad_norm": 18.859101722505248,
"learning_rate": 3.160012878300064e-07,
"logits/chosen": -0.983837902545929,
"logits/rejected": -0.985034167766571,
"logps/chosen": -400.67498779296875,
"logps/rejected": -515.5,
"loss": 0.0057,
"rewards/accuracies": 1.0,
"rewards/chosen": -3.3128905296325684,
"rewards/margins": 15.3515625,
"rewards/rejected": -18.6640625,
"step": 4250
},
{
"epoch": 2.741551335693595,
"grad_norm": 0.19188923573777983,
"learning_rate": 3.143915003219575e-07,
"logits/chosen": -1.030126929283142,
"logits/rejected": -1.056542992591858,
"logps/chosen": -402.17498779296875,
"logps/rejected": -529.5999755859375,
"loss": 0.0133,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.809277296066284,
"rewards/margins": 16.501562118530273,
"rewards/rejected": -19.318750381469727,
"step": 4260
},
{
"epoch": 2.74798841326038,
"grad_norm": 0.30196685444916815,
"learning_rate": 3.1278171281390855e-07,
"logits/chosen": -0.997265636920929,
"logits/rejected": -1.048925757408142,
"logps/chosen": -402.3999938964844,
"logps/rejected": -580.0,
"loss": 0.0344,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.306884765625,
"rewards/margins": 17.953125,
"rewards/rejected": -21.268749237060547,
"step": 4270
},
{
"epoch": 2.7544254908271646,
"grad_norm": 0.10959414872036556,
"learning_rate": 3.111719253058596e-07,
"logits/chosen": -1.031945824623108,
"logits/rejected": -1.056616187095642,
"logps/chosen": -427.4624938964844,
"logps/rejected": -535.9000244140625,
"loss": 0.0092,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.003564357757568,
"rewards/margins": 16.3671875,
"rewards/rejected": -20.381250381469727,
"step": 4280
},
{
"epoch": 2.760862568393949,
"grad_norm": 1.1898548530459272,
"learning_rate": 3.0956213779781064e-07,
"logits/chosen": -0.935986340045929,
"logits/rejected": -0.9755859375,
"logps/chosen": -395.4750061035156,
"logps/rejected": -536.5,
"loss": 0.0402,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -4.188818454742432,
"rewards/margins": 15.578906059265137,
"rewards/rejected": -19.765625,
"step": 4290
},
{
"epoch": 2.7672996459607337,
"grad_norm": 0.0349341778282771,
"learning_rate": 3.0795235028976177e-07,
"logits/chosen": -1.085205078125,
"logits/rejected": -1.1107909679412842,
"logps/chosen": -442.7250061035156,
"logps/rejected": -600.7000122070312,
"loss": 0.0097,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.6946043968200684,
"rewards/margins": 17.035938262939453,
"rewards/rejected": -20.739063262939453,
"step": 4300
},
{
"epoch": 2.7737367235275183,
"grad_norm": 0.022601355069047334,
"learning_rate": 3.063425627817128e-07,
"logits/chosen": -1.023046851158142,
"logits/rejected": -0.9951171875,
"logps/chosen": -410.1000061035156,
"logps/rejected": -555.0,
"loss": 0.0253,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.625805616378784,
"rewards/margins": 16.006250381469727,
"rewards/rejected": -19.629688262939453,
"step": 4310
},
{
"epoch": 2.7801738010943033,
"grad_norm": 0.4877006768131671,
"learning_rate": 3.0473277527366386e-07,
"logits/chosen": -1.080957055091858,
"logits/rejected": -1.0974609851837158,
"logps/chosen": -389.0249938964844,
"logps/rejected": -538.25,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.261798143386841,
"rewards/margins": 16.251562118530273,
"rewards/rejected": -19.510936737060547,
"step": 4320
},
{
"epoch": 2.786610878661088,
"grad_norm": 0.03266239825168514,
"learning_rate": 3.031229877656149e-07,
"logits/chosen": -1.054443359375,
"logits/rejected": -1.0895507335662842,
"logps/chosen": -429.67498779296875,
"logps/rejected": -539.75,
"loss": 0.0094,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.355712890625,
"rewards/margins": 15.524999618530273,
"rewards/rejected": -19.889062881469727,
"step": 4330
},
{
"epoch": 2.7930479562278725,
"grad_norm": 3.742203170068705,
"learning_rate": 3.01513200257566e-07,
"logits/chosen": -1.047509789466858,
"logits/rejected": -1.061767578125,
"logps/chosen": -392.1499938964844,
"logps/rejected": -558.5750122070312,
"loss": 0.0141,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.4574217796325684,
"rewards/margins": 16.379688262939453,
"rewards/rejected": -19.839061737060547,
"step": 4340
},
{
"epoch": 2.799485033794657,
"grad_norm": 1.1471591775678358,
"learning_rate": 2.9990341274951703e-07,
"logits/chosen": -1.0753600597381592,
"logits/rejected": -1.1260833740234375,
"logps/chosen": -400.875,
"logps/rejected": -516.4000244140625,
"loss": 0.0219,
"rewards/accuracies": 0.96875,
"rewards/chosen": -3.001171827316284,
"rewards/margins": 15.435937881469727,
"rewards/rejected": -18.435937881469727,
"step": 4350
},
{
"epoch": 2.8059221113614417,
"grad_norm": 0.16781605556701026,
"learning_rate": 2.982936252414681e-07,
"logits/chosen": -1.0686767101287842,
"logits/rejected": -1.083740234375,
"logps/chosen": -399.0,
"logps/rejected": -552.8499755859375,
"loss": 0.0274,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -3.817089796066284,
"rewards/margins": 15.465624809265137,
"rewards/rejected": -19.284374237060547,
"step": 4360
},
{
"epoch": 2.8123591889282267,
"grad_norm": 1.9416319834531985,
"learning_rate": 2.966838377334192e-07,
"logits/chosen": -1.076025366783142,
"logits/rejected": -1.080078125,
"logps/chosen": -406.5249938964844,
"logps/rejected": -547.0499877929688,
"loss": 0.022,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.145703077316284,
"rewards/margins": 16.671875,
"rewards/rejected": -18.817188262939453,
"step": 4370
},
{
"epoch": 2.8187962664950112,
"grad_norm": 5.762013159949488,
"learning_rate": 2.9507405022537025e-07,
"logits/chosen": -1.105371117591858,
"logits/rejected": -1.121679663658142,
"logps/chosen": -432.67498779296875,
"logps/rejected": -557.6500244140625,
"loss": 0.0176,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.159130811691284,
"rewards/margins": 16.162500381469727,
"rewards/rejected": -19.323436737060547,
"step": 4380
},
{
"epoch": 2.825233344061796,
"grad_norm": 0.9620630047817021,
"learning_rate": 2.9346426271732127e-07,
"logits/chosen": -1.098535180091858,
"logits/rejected": -1.11181640625,
"logps/chosen": -383.42498779296875,
"logps/rejected": -552.375,
"loss": 0.014,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.7589354515075684,
"rewards/margins": 16.293750762939453,
"rewards/rejected": -20.051563262939453,
"step": 4390
},
{
"epoch": 2.831670421628581,
"grad_norm": 0.06912227797655064,
"learning_rate": 2.9185447520927234e-07,
"logits/chosen": -1.1637694835662842,
"logits/rejected": -1.1516602039337158,
"logps/chosen": -392.45001220703125,
"logps/rejected": -568.0999755859375,
"loss": 0.012,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.525561571121216,
"rewards/margins": 16.5859375,
"rewards/rejected": -20.115625381469727,
"step": 4400
},
{
"epoch": 2.8381074991953654,
"grad_norm": 0.23191462260970216,
"learning_rate": 2.902446877012234e-07,
"logits/chosen": -1.08929443359375,
"logits/rejected": -1.105126976966858,
"logps/chosen": -389.67498779296875,
"logps/rejected": -540.0499877929688,
"loss": 0.0138,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.943164110183716,
"rewards/margins": 15.912500381469727,
"rewards/rejected": -18.854686737060547,
"step": 4410
},
{
"epoch": 2.84454457676215,
"grad_norm": 0.22733204817053218,
"learning_rate": 2.886349001931745e-07,
"logits/chosen": -1.051367163658142,
"logits/rejected": -1.085546851158142,
"logps/chosen": -441.1000061035156,
"logps/rejected": -564.75,
"loss": 0.0176,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -2.992919921875,
"rewards/margins": 14.8984375,
"rewards/rejected": -17.885936737060547,
"step": 4420
},
{
"epoch": 2.8509816543289346,
"grad_norm": 0.35599187838621965,
"learning_rate": 2.870251126851255e-07,
"logits/chosen": -1.1135742664337158,
"logits/rejected": -1.129785180091858,
"logps/chosen": -402.0249938964844,
"logps/rejected": -500.67498779296875,
"loss": 0.0251,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.205517530441284,
"rewards/margins": 15.65625,
"rewards/rejected": -17.860937118530273,
"step": 4430
},
{
"epoch": 2.857418731895719,
"grad_norm": 0.5999684700633137,
"learning_rate": 2.8541532517707664e-07,
"logits/chosen": -1.177343726158142,
"logits/rejected": -1.2083008289337158,
"logps/chosen": -423.8999938964844,
"logps/rejected": -576.5999755859375,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.318981885910034,
"rewards/margins": 16.435937881469727,
"rewards/rejected": -18.759374618530273,
"step": 4440
},
{
"epoch": 2.863855809462504,
"grad_norm": 0.41307829335787627,
"learning_rate": 2.8380553766902766e-07,
"logits/chosen": -1.1286132335662842,
"logits/rejected": -1.140625,
"logps/chosen": -418.79998779296875,
"logps/rejected": -560.75,
"loss": 0.0131,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -2.341552734375,
"rewards/margins": 16.698436737060547,
"rewards/rejected": -19.03125,
"step": 4450
},
{
"epoch": 2.8702928870292888,
"grad_norm": 0.06329392464426446,
"learning_rate": 2.8219575016097873e-07,
"logits/chosen": -1.0729491710662842,
"logits/rejected": -1.0994141101837158,
"logps/chosen": -405.7749938964844,
"logps/rejected": -532.4500122070312,
"loss": 0.0218,
"rewards/accuracies": 0.96875,
"rewards/chosen": -2.7913575172424316,
"rewards/margins": 15.798437118530273,
"rewards/rejected": -18.600000381469727,
"step": 4460
},
{
"epoch": 2.8767299645960733,
"grad_norm": 0.5929940057123108,
"learning_rate": 2.8058596265292975e-07,
"logits/chosen": -1.12939453125,
"logits/rejected": -1.158447265625,
"logps/chosen": -425.6000061035156,
"logps/rejected": -554.8499755859375,
"loss": 0.009,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -2.7857298851013184,
"rewards/margins": 16.956249237060547,
"rewards/rejected": -19.728124618530273,
"step": 4470
},
{
"epoch": 2.883167042162858,
"grad_norm": 10.781761622532624,
"learning_rate": 2.789761751448809e-07,
"logits/chosen": -1.1557128429412842,
"logits/rejected": -1.17626953125,
"logps/chosen": -387.67498779296875,
"logps/rejected": -530.3499755859375,
"loss": 0.0136,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.205273389816284,
"rewards/margins": 15.399999618530273,
"rewards/rejected": -18.606250762939453,
"step": 4480
},
{
"epoch": 2.8896041197296425,
"grad_norm": 5.678623060839604,
"learning_rate": 2.773663876368319e-07,
"logits/chosen": -1.122949242591858,
"logits/rejected": -1.1169922351837158,
"logps/chosen": -412.875,
"logps/rejected": -559.7000122070312,
"loss": 0.0155,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.047656059265137,
"rewards/margins": 15.893750190734863,
"rewards/rejected": -19.956249237060547,
"step": 4490
},
{
"epoch": 2.8960411972964275,
"grad_norm": 0.12843353367463994,
"learning_rate": 2.7575660012878297e-07,
"logits/chosen": -1.0998046398162842,
"logits/rejected": -1.0850098133087158,
"logps/chosen": -403.29998779296875,
"logps/rejected": -578.4000244140625,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.0653076171875,
"rewards/margins": 15.801562309265137,
"rewards/rejected": -19.857812881469727,
"step": 4500
},
{
"epoch": 2.902478274863212,
"grad_norm": 0.18293130358900542,
"learning_rate": 2.7414681262073405e-07,
"logits/chosen": -1.146093726158142,
"logits/rejected": -1.1618163585662842,
"logps/chosen": -414.625,
"logps/rejected": -538.0999755859375,
"loss": 0.0088,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -3.832763671875,
"rewards/margins": 16.057811737060547,
"rewards/rejected": -19.892187118530273,
"step": 4510
},
{
"epoch": 2.9089153524299967,
"grad_norm": 15.929814025771526,
"learning_rate": 2.725370251126851e-07,
"logits/chosen": -1.20361328125,
"logits/rejected": -1.2047851085662842,
"logps/chosen": -441.79998779296875,
"logps/rejected": -596.75,
"loss": 0.0151,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.934033155441284,
"rewards/margins": 17.510936737060547,
"rewards/rejected": -21.459375381469727,
"step": 4520
},
{
"epoch": 2.9153524299967817,
"grad_norm": 26.74681492633243,
"learning_rate": 2.7092723760463614e-07,
"logits/chosen": -1.161865234375,
"logits/rejected": -1.198339819908142,
"logps/chosen": -409.6000061035156,
"logps/rejected": -548.0999755859375,
"loss": 0.0184,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -3.522265672683716,
"rewards/margins": 16.2265625,
"rewards/rejected": -19.748437881469727,
"step": 4530
},
{
"epoch": 2.9217895075635663,
"grad_norm": 0.18148041344029991,
"learning_rate": 2.6931745009658727e-07,
"logits/chosen": -1.149511694908142,
"logits/rejected": -1.160742163658142,
"logps/chosen": -404.625,
"logps/rejected": -598.25,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.6748046875,
"rewards/margins": 17.774999618530273,
"rewards/rejected": -22.448436737060547,
"step": 4540
},
{
"epoch": 2.928226585130351,
"grad_norm": 0.09689001421228971,
"learning_rate": 2.677076625885383e-07,
"logits/chosen": -1.1152832508087158,
"logits/rejected": -1.1346313953399658,
"logps/chosen": -404.6875,
"logps/rejected": -555.875,
"loss": 0.026,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -4.319580078125,
"rewards/margins": 17.51171875,
"rewards/rejected": -21.8203125,
"step": 4550
},
{
"epoch": 2.9346636626971354,
"grad_norm": 0.8349717835904119,
"learning_rate": 2.6609787508048936e-07,
"logits/chosen": -1.2187011241912842,
"logits/rejected": -1.26025390625,
"logps/chosen": -419.57501220703125,
"logps/rejected": -553.0,
"loss": 0.0051,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.408154487609863,
"rewards/margins": 16.829687118530273,
"rewards/rejected": -21.245311737060547,
"step": 4560
},
{
"epoch": 2.94110074026392,
"grad_norm": 0.0018520052569766796,
"learning_rate": 2.644880875724404e-07,
"logits/chosen": -1.1864745616912842,
"logits/rejected": -1.1776854991912842,
"logps/chosen": -429.125,
"logps/rejected": -587.4500122070312,
"loss": 0.0065,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.62286376953125,
"rewards/margins": 17.575000762939453,
"rewards/rejected": -23.203125,
"step": 4570
},
{
"epoch": 2.947537817830705,
"grad_norm": 0.9827245912908983,
"learning_rate": 2.628783000643915e-07,
"logits/chosen": -1.075048804283142,
"logits/rejected": -1.100341796875,
"logps/chosen": -450.88751220703125,
"logps/rejected": -579.8499755859375,
"loss": 0.0218,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.349609375,
"rewards/margins": 17.246875762939453,
"rewards/rejected": -22.5859375,
"step": 4580
},
{
"epoch": 2.9539748953974896,
"grad_norm": 2.808445023918683,
"learning_rate": 2.6126851255634253e-07,
"logits/chosen": -1.074462890625,
"logits/rejected": -1.122167944908142,
"logps/chosen": -404.38751220703125,
"logps/rejected": -577.3499755859375,
"loss": 0.0465,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": -5.451562404632568,
"rewards/margins": 16.517187118530273,
"rewards/rejected": -21.970312118530273,
"step": 4590
},
{
"epoch": 2.960411972964274,
"grad_norm": 0.31073133311477225,
"learning_rate": 2.596587250482936e-07,
"logits/chosen": -1.086157202720642,
"logits/rejected": -1.089868187904358,
"logps/chosen": -421.4624938964844,
"logps/rejected": -573.3499755859375,
"loss": 0.0195,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.573144435882568,
"rewards/margins": 17.239843368530273,
"rewards/rejected": -22.795312881469727,
"step": 4600
},
{
"epoch": 2.9668490505310587,
"grad_norm": 0.068889903289002,
"learning_rate": 2.580489375402447e-07,
"logits/chosen": -1.0750000476837158,
"logits/rejected": -1.1067383289337158,
"logps/chosen": -408.54998779296875,
"logps/rejected": -580.625,
"loss": 0.0148,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -4.872363090515137,
"rewards/margins": 17.399999618530273,
"rewards/rejected": -22.2890625,
"step": 4610
},
{
"epoch": 2.9732861280978433,
"grad_norm": 0.6319961977568703,
"learning_rate": 2.5643915003219575e-07,
"logits/chosen": -1.137109398841858,
"logits/rejected": -1.150292992591858,
"logps/chosen": -435.17498779296875,
"logps/rejected": -535.0,
"loss": 0.0127,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.769067287445068,
"rewards/margins": 15.90625,
"rewards/rejected": -20.671875,
"step": 4620
},
{
"epoch": 2.9797232056646283,
"grad_norm": 0.008954633914854768,
"learning_rate": 2.5482936252414677e-07,
"logits/chosen": -1.117285132408142,
"logits/rejected": -1.121679663658142,
"logps/chosen": -465.875,
"logps/rejected": -593.4000244140625,
"loss": 0.0262,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -4.642480373382568,
"rewards/margins": 16.438282012939453,
"rewards/rejected": -21.082813262939453,
"step": 4630
},
{
"epoch": 2.986160283231413,
"grad_norm": 0.2715041175189798,
"learning_rate": 2.5321957501609784e-07,
"logits/chosen": -1.084082007408142,
"logits/rejected": -1.119775414466858,
"logps/chosen": -480.92498779296875,
"logps/rejected": -611.3499755859375,
"loss": 0.0071,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.862011909484863,
"rewards/margins": 17.3046875,
"rewards/rejected": -22.178125381469727,
"step": 4640
},
{
"epoch": 2.9925973607981975,
"grad_norm": 0.07398779198819364,
"learning_rate": 2.516097875080489e-07,
"logits/chosen": -1.11474609375,
"logits/rejected": -1.156152367591858,
"logps/chosen": -449.57501220703125,
"logps/rejected": -600.5999755859375,
"loss": 0.0117,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -4.337744235992432,
"rewards/margins": 17.264062881469727,
"rewards/rejected": -21.604686737060547,
"step": 4650
},
{
"epoch": 2.9990344383649825,
"grad_norm": 0.6036221444805209,
"learning_rate": 2.5e-07,
"logits/chosen": -1.118505835533142,
"logits/rejected": -1.121191382408142,
"logps/chosen": -417.1000061035156,
"logps/rejected": -584.4000244140625,
"loss": 0.0179,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -3.984081983566284,
"rewards/margins": 17.8046875,
"rewards/rejected": -21.784374237060547,
"step": 4660
},
{
"epoch": 3.005149662053428,
"grad_norm": 0.02049975193867326,
"learning_rate": 2.4839021249195106e-07,
"logits/chosen": -1.1468955278396606,
"logits/rejected": -1.1493626832962036,
"logps/chosen": -438.1052551269531,
"logps/rejected": -590.6842041015625,
"loss": 0.0043,
"rewards/accuracies": 0.9934210777282715,
"rewards/chosen": -5.279964923858643,
"rewards/margins": 18.324012756347656,
"rewards/rejected": -23.601974487304688,
"step": 4670
},
{
"epoch": 3.0115867396202125,
"grad_norm": 0.007171380019719538,
"learning_rate": 2.4678042498390214e-07,
"logits/chosen": -1.125341773033142,
"logits/rejected": -1.152099609375,
"logps/chosen": -459.7749938964844,
"logps/rejected": -600.5499877929688,
"loss": 0.0015,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.583300590515137,
"rewards/margins": 17.621875762939453,
"rewards/rejected": -23.206249237060547,
"step": 4680
},
{
"epoch": 3.018023817186997,
"grad_norm": 0.015194056176862642,
"learning_rate": 2.4517063747585316e-07,
"logits/chosen": -1.083105444908142,
"logits/rejected": -1.109155297279358,
"logps/chosen": -415.1000061035156,
"logps/rejected": -594.9500122070312,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -4.552294731140137,
"rewards/margins": 19.375,
"rewards/rejected": -23.924999237060547,
"step": 4690
},
{
"epoch": 3.0244608947537817,
"grad_norm": 4.468715166239343,
"learning_rate": 2.4356084996780423e-07,
"logits/chosen": -1.2006347179412842,
"logits/rejected": -1.192480444908142,
"logps/chosen": -440.1000061035156,
"logps/rejected": -595.4500122070312,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.480175971984863,
"rewards/margins": 18.094532012939453,
"rewards/rejected": -23.568750381469727,
"step": 4700
},
{
"epoch": 3.0308979723205667,
"grad_norm": 0.021122244530159647,
"learning_rate": 2.419510624597553e-07,
"logits/chosen": -1.069067358970642,
"logits/rejected": -1.050115942955017,
"logps/chosen": -445.5,
"logps/rejected": -602.0499877929688,
"loss": 0.0092,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.22955322265625,
"rewards/margins": 17.5,
"rewards/rejected": -22.737499237060547,
"step": 4710
},
{
"epoch": 3.0373350498873513,
"grad_norm": 0.03307507714663866,
"learning_rate": 2.403412749517064e-07,
"logits/chosen": -1.173242211341858,
"logits/rejected": -1.1818358898162842,
"logps/chosen": -433.1000061035156,
"logps/rejected": -591.5999755859375,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -4.977221488952637,
"rewards/margins": 18.759374618530273,
"rewards/rejected": -23.740625381469727,
"step": 4720
},
{
"epoch": 3.043772127454136,
"grad_norm": 0.02934355373683881,
"learning_rate": 2.3873148744365745e-07,
"logits/chosen": -1.133935570716858,
"logits/rejected": -1.1240723133087158,
"logps/chosen": -412.6499938964844,
"logps/rejected": -562.75,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.184765815734863,
"rewards/margins": 18.248437881469727,
"rewards/rejected": -23.424999237060547,
"step": 4730
},
{
"epoch": 3.0502092050209204,
"grad_norm": 0.019452870159428832,
"learning_rate": 2.371216999356085e-07,
"logits/chosen": -1.0964844226837158,
"logits/rejected": -1.0937011241912842,
"logps/chosen": -428.2749938964844,
"logps/rejected": -587.7999877929688,
"loss": 0.026,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -6.134753227233887,
"rewards/margins": 17.532032012939453,
"rewards/rejected": -23.657812118530273,
"step": 4740
},
{
"epoch": 3.056646282587705,
"grad_norm": 0.01026781399221231,
"learning_rate": 2.3551191242755954e-07,
"logits/chosen": -1.1647460460662842,
"logits/rejected": -1.160058617591858,
"logps/chosen": -442.70001220703125,
"logps/rejected": -598.5499877929688,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.059496879577637,
"rewards/margins": 20.454687118530273,
"rewards/rejected": -25.529687881469727,
"step": 4750
},
{
"epoch": 3.06308336015449,
"grad_norm": 0.28593764965232715,
"learning_rate": 2.3390212491951062e-07,
"logits/chosen": -1.155908226966858,
"logits/rejected": -1.1824219226837158,
"logps/chosen": -442.8500061035156,
"logps/rejected": -572.7000122070312,
"loss": 0.0224,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.127831935882568,
"rewards/margins": 17.984375,
"rewards/rejected": -23.118749618530273,
"step": 4760
},
{
"epoch": 3.0695204377212746,
"grad_norm": 0.003290033796275054,
"learning_rate": 2.3229233741146166e-07,
"logits/chosen": -1.203222632408142,
"logits/rejected": -1.217187523841858,
"logps/chosen": -454.8500061035156,
"logps/rejected": -630.7000122070312,
"loss": 0.0021,
"rewards/accuracies": 1.0,
"rewards/chosen": -5.734375,
"rewards/margins": 19.578125,
"rewards/rejected": -25.309375762939453,
"step": 4770
},
{
"epoch": 3.075957515288059,
"grad_norm": 0.0017905173138558442,
"learning_rate": 2.3068254990341274e-07,
"logits/chosen": -1.1566894054412842,
"logits/rejected": -1.195703148841858,
"logps/chosen": -481.125,
"logps/rejected": -612.9000244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -7.490429878234863,
"rewards/margins": 18.299999237060547,
"rewards/rejected": -25.787500381469727,
"step": 4780
},
{
"epoch": 3.0823945928548437,
"grad_norm": 1.331154357210038,
"learning_rate": 2.290727623953638e-07,
"logits/chosen": -1.2042968273162842,
"logits/rejected": -1.212011694908142,
"logps/chosen": -475.0249938964844,
"logps/rejected": -620.4500122070312,
"loss": 0.0133,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -7.7841796875,
"rewards/margins": 19.067188262939453,
"rewards/rejected": -26.856250762939453,
"step": 4790
},
{
"epoch": 3.0888316704216288,
"grad_norm": 0.008913213065396297,
"learning_rate": 2.2746297488731486e-07,
"logits/chosen": -1.195410132408142,
"logits/rejected": -1.2082030773162842,
"logps/chosen": -421.79998779296875,
"logps/rejected": -622.4000244140625,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.528954982757568,
"rewards/margins": 19.818750381469727,
"rewards/rejected": -26.353124618530273,
"step": 4800
},
{
"epoch": 3.0952687479884133,
"grad_norm": 0.1029343972347026,
"learning_rate": 2.2585318737926593e-07,
"logits/chosen": -1.1962890625,
"logits/rejected": -1.1948730945587158,
"logps/chosen": -438.8999938964844,
"logps/rejected": -587.0499877929688,
"loss": 0.0029,
"rewards/accuracies": 1.0,
"rewards/chosen": -7.034863471984863,
"rewards/margins": 19.465625762939453,
"rewards/rejected": -26.515625,
"step": 4810
},
{
"epoch": 3.101705825555198,
"grad_norm": 0.00040497685294049686,
"learning_rate": 2.2424339987121698e-07,
"logits/chosen": -1.1691405773162842,
"logits/rejected": -1.1959960460662842,
"logps/chosen": -445.5249938964844,
"logps/rejected": -604.0499877929688,
"loss": 0.0,
"rewards/accuracies": 1.0,
"rewards/chosen": -7.252734184265137,
"rewards/margins": 19.690624237060547,
"rewards/rejected": -26.931249618530273,
"step": 4820
},
{
"epoch": 3.1081429031219825,
"grad_norm": 0.15227806520684364,
"learning_rate": 2.2263361236316805e-07,
"logits/chosen": -1.1714355945587158,
"logits/rejected": -1.162451148033142,
"logps/chosen": -425.70001220703125,
"logps/rejected": -615.7000122070312,
"loss": 0.0054,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -7.599999904632568,
"rewards/margins": 19.184375762939453,
"rewards/rejected": -26.774999618530273,
"step": 4830
},
{
"epoch": 3.1145799806887675,
"grad_norm": 0.023311318939842125,
"learning_rate": 2.210238248551191e-07,
"logits/chosen": -1.174707055091858,
"logits/rejected": -1.1965820789337158,
"logps/chosen": -453.04998779296875,
"logps/rejected": -608.7999877929688,
"loss": 0.0132,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -7.903124809265137,
"rewards/margins": 18.704687118530273,
"rewards/rejected": -26.618749618530273,
"step": 4840
},
{
"epoch": 3.121017058255552,
"grad_norm": 10.786296882917435,
"learning_rate": 2.1941403734707017e-07,
"logits/chosen": -1.1326172351837158,
"logits/rejected": -1.1515624523162842,
"logps/chosen": -422.5249938964844,
"logps/rejected": -609.1500244140625,
"loss": 0.0135,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -7.811327934265137,
"rewards/margins": 18.329687118530273,
"rewards/rejected": -26.146875381469727,
"step": 4850
},
{
"epoch": 3.1274541358223367,
"grad_norm": 0.01329847930022698,
"learning_rate": 2.1780424983902125e-07,
"logits/chosen": -1.146520972251892,
"logits/rejected": -1.1954345703125,
"logps/chosen": -444.375,
"logps/rejected": -611.2999877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.67236328125,
"rewards/margins": 18.916406631469727,
"rewards/rejected": -25.596874237060547,
"step": 4860
},
{
"epoch": 3.1338912133891212,
"grad_norm": 0.04550344760940479,
"learning_rate": 2.161944623309723e-07,
"logits/chosen": -1.194433569908142,
"logits/rejected": -1.233496069908142,
"logps/chosen": -418.92498779296875,
"logps/rejected": -581.0,
"loss": 0.0054,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -7.391015529632568,
"rewards/margins": 18.495311737060547,
"rewards/rejected": -25.868749618530273,
"step": 4870
},
{
"epoch": 3.140328290955906,
"grad_norm": 0.11635747842049714,
"learning_rate": 2.1458467482292337e-07,
"logits/chosen": -1.123266577720642,
"logits/rejected": -1.149194359779358,
"logps/chosen": -495.25,
"logps/rejected": -631.2000122070312,
"loss": 0.0056,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.9462890625,
"rewards/margins": 19.1015625,
"rewards/rejected": -26.037500381469727,
"step": 4880
},
{
"epoch": 3.146765368522691,
"grad_norm": 0.0015098347770240576,
"learning_rate": 2.129748873148744e-07,
"logits/chosen": -1.099462866783142,
"logits/rejected": -1.12841796875,
"logps/chosen": -447.04998779296875,
"logps/rejected": -605.0499877929688,
"loss": 0.0045,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.196093559265137,
"rewards/margins": 19.821874618530273,
"rewards/rejected": -26.018749237060547,
"step": 4890
},
{
"epoch": 3.1532024460894754,
"grad_norm": 0.06132780820289997,
"learning_rate": 2.1136509980682549e-07,
"logits/chosen": -1.181860327720642,
"logits/rejected": -1.214599609375,
"logps/chosen": -458.0249938964844,
"logps/rejected": -618.4000244140625,
"loss": 0.0045,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.970703125,
"rewards/margins": 18.651561737060547,
"rewards/rejected": -25.634374618530273,
"step": 4900
},
{
"epoch": 3.15963952365626,
"grad_norm": 0.015670466658027772,
"learning_rate": 2.0975531229877656e-07,
"logits/chosen": -1.186669945716858,
"logits/rejected": -1.179956078529358,
"logps/chosen": -451.1499938964844,
"logps/rejected": -623.6500244140625,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.311132907867432,
"rewards/margins": 18.420312881469727,
"rewards/rejected": -24.734375,
"step": 4910
},
{
"epoch": 3.1660766012230446,
"grad_norm": 0.7860096166411907,
"learning_rate": 2.081455247907276e-07,
"logits/chosen": -1.139672875404358,
"logits/rejected": -1.1612060070037842,
"logps/chosen": -434.07501220703125,
"logps/rejected": -601.9000244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.775292873382568,
"rewards/margins": 18.990625381469727,
"rewards/rejected": -24.756250381469727,
"step": 4920
},
{
"epoch": 3.1725136787898296,
"grad_norm": 0.009808484495203735,
"learning_rate": 2.0653573728267868e-07,
"logits/chosen": -1.0760498046875,
"logits/rejected": -1.0888671875,
"logps/chosen": -405.92498779296875,
"logps/rejected": -592.4500122070312,
"loss": 0.0256,
"rewards/accuracies": 0.96875,
"rewards/chosen": -7.089453220367432,
"rewards/margins": 18.778125762939453,
"rewards/rejected": -25.860937118530273,
"step": 4930
},
{
"epoch": 3.178950756356614,
"grad_norm": 0.0016510487300226008,
"learning_rate": 2.0492594977462973e-07,
"logits/chosen": -1.156835913658142,
"logits/rejected": -1.186132788658142,
"logps/chosen": -437.20001220703125,
"logps/rejected": -580.5,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.806250095367432,
"rewards/margins": 18.1875,
"rewards/rejected": -24.0234375,
"step": 4940
},
{
"epoch": 3.1853878339233987,
"grad_norm": 0.04680967562897145,
"learning_rate": 2.033161622665808e-07,
"logits/chosen": -1.114355444908142,
"logits/rejected": -1.157324194908142,
"logps/chosen": -447.20001220703125,
"logps/rejected": -595.4000244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.834228515625,
"rewards/margins": 16.8828125,
"rewards/rejected": -22.717187881469727,
"step": 4950
},
{
"epoch": 3.1918249114901833,
"grad_norm": 0.03766884792215408,
"learning_rate": 2.0170637475853185e-07,
"logits/chosen": -1.107934594154358,
"logits/rejected": -1.1571044921875,
"logps/chosen": -463.6000061035156,
"logps/rejected": -588.5999755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.200463771820068,
"rewards/margins": 18.962499618530273,
"rewards/rejected": -24.15625,
"step": 4960
},
{
"epoch": 3.1982619890569683,
"grad_norm": 0.032789307952724236,
"learning_rate": 2.0009658725048292e-07,
"logits/chosen": -1.143945336341858,
"logits/rejected": -1.173437476158142,
"logps/chosen": -460.0,
"logps/rejected": -598.0499877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.598474025726318,
"rewards/margins": 18.3203125,
"rewards/rejected": -23.903125762939453,
"step": 4970
},
{
"epoch": 3.204699066623753,
"grad_norm": 0.014658227990306128,
"learning_rate": 1.98486799742434e-07,
"logits/chosen": -1.2394530773162842,
"logits/rejected": -1.252832055091858,
"logps/chosen": -451.29998779296875,
"logps/rejected": -618.7999877929688,
"loss": 0.0088,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.079833984375,
"rewards/margins": 19.456249237060547,
"rewards/rejected": -25.534374237060547,
"step": 4980
},
{
"epoch": 3.2111361441905375,
"grad_norm": 0.046097116270495335,
"learning_rate": 1.9687701223438504e-07,
"logits/chosen": -1.2252929210662842,
"logits/rejected": -1.2561523914337158,
"logps/chosen": -442.57501220703125,
"logps/rejected": -594.75,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.322241306304932,
"rewards/margins": 19.120311737060547,
"rewards/rejected": -25.435937881469727,
"step": 4990
},
{
"epoch": 3.217573221757322,
"grad_norm": 0.09069092869768736,
"learning_rate": 1.9526722472633612e-07,
"logits/chosen": -1.132568359375,
"logits/rejected": -1.156494140625,
"logps/chosen": -425.82501220703125,
"logps/rejected": -578.7000122070312,
"loss": 0.0174,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.106738090515137,
"rewards/margins": 18.545312881469727,
"rewards/rejected": -24.645313262939453,
"step": 5000
},
{
"epoch": 3.2240102993241067,
"grad_norm": 0.01590234525948529,
"learning_rate": 1.9365743721828716e-07,
"logits/chosen": -1.1720702648162842,
"logits/rejected": -1.216406226158142,
"logps/chosen": -410.375,
"logps/rejected": -574.5999755859375,
"loss": 0.0216,
"rewards/accuracies": 0.96875,
"rewards/chosen": -6.863867282867432,
"rewards/margins": 18.245311737060547,
"rewards/rejected": -25.118749618530273,
"step": 5010
},
{
"epoch": 3.2304473768908917,
"grad_norm": 0.005519486507844155,
"learning_rate": 1.9204764971023824e-07,
"logits/chosen": -1.161962866783142,
"logits/rejected": -1.197119116783142,
"logps/chosen": -420.7250061035156,
"logps/rejected": -583.4000244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.3515625,
"rewards/margins": 19.045312881469727,
"rewards/rejected": -25.3828125,
"step": 5020
},
{
"epoch": 3.2368844544576763,
"grad_norm": 0.004607457293818073,
"learning_rate": 1.904378622021893e-07,
"logits/chosen": -1.165283203125,
"logits/rejected": -1.167138695716858,
"logps/chosen": -445.92498779296875,
"logps/rejected": -614.1500244140625,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.177538871765137,
"rewards/margins": 19.678125381469727,
"rewards/rejected": -25.84375,
"step": 5030
},
{
"epoch": 3.243321532024461,
"grad_norm": 0.7275701284809951,
"learning_rate": 1.8882807469414036e-07,
"logits/chosen": -1.1663086414337158,
"logits/rejected": -1.1945312023162842,
"logps/chosen": -407.82501220703125,
"logps/rejected": -566.5499877929688,
"loss": 0.0113,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.144921779632568,
"rewards/margins": 18.651561737060547,
"rewards/rejected": -24.7734375,
"step": 5040
},
{
"epoch": 3.2497586095912454,
"grad_norm": 0.00925264942928273,
"learning_rate": 1.8721828718609143e-07,
"logits/chosen": -1.0818359851837158,
"logits/rejected": -1.1124999523162842,
"logps/chosen": -422.625,
"logps/rejected": -599.2000122070312,
"loss": 0.0216,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.3525390625,
"rewards/margins": 18.346874237060547,
"rewards/rejected": -23.692188262939453,
"step": 5050
},
{
"epoch": 3.2561956871580304,
"grad_norm": 0.018748740799270636,
"learning_rate": 1.8560849967804248e-07,
"logits/chosen": -1.139746069908142,
"logits/rejected": -1.134374976158142,
"logps/chosen": -432.95001220703125,
"logps/rejected": -592.5,
"loss": 0.0263,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -6.676465034484863,
"rewards/margins": 17.557811737060547,
"rewards/rejected": -24.228124618530273,
"step": 5060
},
{
"epoch": 3.262632764724815,
"grad_norm": 0.009384866899820094,
"learning_rate": 1.8399871216999355e-07,
"logits/chosen": -1.19677734375,
"logits/rejected": -1.204199194908142,
"logps/chosen": -433.67498779296875,
"logps/rejected": -604.8499755859375,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.350488185882568,
"rewards/margins": 18.135936737060547,
"rewards/rejected": -23.475000381469727,
"step": 5070
},
{
"epoch": 3.2690698422915996,
"grad_norm": 0.02147237650112711,
"learning_rate": 1.823889246619446e-07,
"logits/chosen": -1.2500488758087158,
"logits/rejected": -1.2795898914337158,
"logps/chosen": -481.875,
"logps/rejected": -612.6500244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -7.387597560882568,
"rewards/margins": 17.568750381469727,
"rewards/rejected": -24.957813262939453,
"step": 5080
},
{
"epoch": 3.275506919858384,
"grad_norm": 0.02187166539536812,
"learning_rate": 1.8077913715389567e-07,
"logits/chosen": -1.118310570716858,
"logits/rejected": -1.1315186023712158,
"logps/chosen": -412.5,
"logps/rejected": -595.2999877929688,
"loss": 0.0303,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -5.707812309265137,
"rewards/margins": 18.108592987060547,
"rewards/rejected": -23.81640625,
"step": 5090
},
{
"epoch": 3.281943997425169,
"grad_norm": 0.13063587935498464,
"learning_rate": 1.7916934964584674e-07,
"logits/chosen": -1.181549072265625,
"logits/rejected": -1.2327148914337158,
"logps/chosen": -423.9750061035156,
"logps/rejected": -615.6500244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -7.080273628234863,
"rewards/margins": 18.559375762939453,
"rewards/rejected": -25.653125762939453,
"step": 5100
},
{
"epoch": 3.2883810749919538,
"grad_norm": 0.005783772596752793,
"learning_rate": 1.775595621377978e-07,
"logits/chosen": -1.120336890220642,
"logits/rejected": -1.1363036632537842,
"logps/chosen": -441.20001220703125,
"logps/rejected": -580.0499877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.895410060882568,
"rewards/margins": 18.892187118530273,
"rewards/rejected": -24.774999618530273,
"step": 5110
},
{
"epoch": 3.2948181525587383,
"grad_norm": 0.009963166845550958,
"learning_rate": 1.7594977462974886e-07,
"logits/chosen": -1.1458008289337158,
"logits/rejected": -1.1650879383087158,
"logps/chosen": -396.3500061035156,
"logps/rejected": -568.3499755859375,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.274755954742432,
"rewards/margins": 18.643749237060547,
"rewards/rejected": -24.907812118530273,
"step": 5120
},
{
"epoch": 3.301255230125523,
"grad_norm": 0.06936182148963972,
"learning_rate": 1.743399871216999e-07,
"logits/chosen": -1.218896508216858,
"logits/rejected": -1.230566382408142,
"logps/chosen": -452.2749938964844,
"logps/rejected": -606.5999755859375,
"loss": 0.0101,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.982812404632568,
"rewards/margins": 17.821874618530273,
"rewards/rejected": -23.8203125,
"step": 5130
},
{
"epoch": 3.3076923076923075,
"grad_norm": 0.004261491928143392,
"learning_rate": 1.7273019961365098e-07,
"logits/chosen": -1.1884276866912842,
"logits/rejected": -1.212499976158142,
"logps/chosen": -437.8999938964844,
"logps/rejected": -612.7999877929688,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.523461818695068,
"rewards/margins": 20.407812118530273,
"rewards/rejected": -25.935937881469727,
"step": 5140
},
{
"epoch": 3.3141293852590925,
"grad_norm": 0.013833502764908275,
"learning_rate": 1.7112041210560206e-07,
"logits/chosen": -1.161230444908142,
"logits/rejected": -1.194726586341858,
"logps/chosen": -460.1000061035156,
"logps/rejected": -585.75,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.311327934265137,
"rewards/margins": 17.731250762939453,
"rewards/rejected": -24.037500381469727,
"step": 5150
},
{
"epoch": 3.320566462825877,
"grad_norm": 0.02845853102131737,
"learning_rate": 1.695106245975531e-07,
"logits/chosen": -1.135888695716858,
"logits/rejected": -1.14990234375,
"logps/chosen": -443.6000061035156,
"logps/rejected": -636.25,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.395410060882568,
"rewards/margins": 19.323436737060547,
"rewards/rejected": -24.731250762939453,
"step": 5160
},
{
"epoch": 3.3270035403926617,
"grad_norm": 0.0038233653605419843,
"learning_rate": 1.6790083708950418e-07,
"logits/chosen": -1.1759765148162842,
"logits/rejected": -1.20068359375,
"logps/chosen": -446.75,
"logps/rejected": -607.7000122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.467577934265137,
"rewards/margins": 19.192188262939453,
"rewards/rejected": -25.649999618530273,
"step": 5170
},
{
"epoch": 3.3334406179594462,
"grad_norm": 1.268747881939313,
"learning_rate": 1.6629104958145523e-07,
"logits/chosen": -1.114404320716858,
"logits/rejected": -1.1251952648162842,
"logps/chosen": -414.70001220703125,
"logps/rejected": -584.0499877929688,
"loss": 0.0091,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.07421875,
"rewards/margins": 19.090625762939453,
"rewards/rejected": -25.174999237060547,
"step": 5180
},
{
"epoch": 3.3398776955262313,
"grad_norm": 0.11625811094142115,
"learning_rate": 1.646812620734063e-07,
"logits/chosen": -1.169042944908142,
"logits/rejected": -1.19970703125,
"logps/chosen": -440.625,
"logps/rejected": -621.0499877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.413671970367432,
"rewards/margins": 18.1328125,
"rewards/rejected": -24.542186737060547,
"step": 5190
},
{
"epoch": 3.346314773093016,
"grad_norm": 0.01457558814733387,
"learning_rate": 1.6307147456535735e-07,
"logits/chosen": -1.1357421875,
"logits/rejected": -1.1613280773162842,
"logps/chosen": -445.125,
"logps/rejected": -589.5,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.311450004577637,
"rewards/margins": 18.700000762939453,
"rewards/rejected": -25.009374618530273,
"step": 5200
},
{
"epoch": 3.3527518506598004,
"grad_norm": 0.0318603012676317,
"learning_rate": 1.6146168705730842e-07,
"logits/chosen": -1.173583984375,
"logits/rejected": -1.1763184070587158,
"logps/chosen": -449.125,
"logps/rejected": -632.0499877929688,
"loss": 0.0201,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.589745998382568,
"rewards/margins": 18.8046875,
"rewards/rejected": -25.396875381469727,
"step": 5210
},
{
"epoch": 3.359188928226585,
"grad_norm": 0.037256736610292676,
"learning_rate": 1.598518995492595e-07,
"logits/chosen": -1.100341796875,
"logits/rejected": -1.1125977039337158,
"logps/chosen": -424.2250061035156,
"logps/rejected": -582.9000244140625,
"loss": 0.026,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -6.180517673492432,
"rewards/margins": 18.310937881469727,
"rewards/rejected": -24.490625381469727,
"step": 5220
},
{
"epoch": 3.36562600579337,
"grad_norm": 0.10211936783870917,
"learning_rate": 1.5824211204121054e-07,
"logits/chosen": -1.0896484851837158,
"logits/rejected": -1.1443359851837158,
"logps/chosen": -449.375,
"logps/rejected": -602.0499877929688,
"loss": 0.0177,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.273779392242432,
"rewards/margins": 17.615625381469727,
"rewards/rejected": -23.881250381469727,
"step": 5230
},
{
"epoch": 3.3720630833601546,
"grad_norm": 0.01454528726990812,
"learning_rate": 1.566323245331616e-07,
"logits/chosen": -1.1654052734375,
"logits/rejected": -1.2077147960662842,
"logps/chosen": -443.2250061035156,
"logps/rejected": -612.1500244140625,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.409081935882568,
"rewards/margins": 19.645313262939453,
"rewards/rejected": -26.056249618530273,
"step": 5240
},
{
"epoch": 3.378500160926939,
"grad_norm": 0.9637410547971565,
"learning_rate": 1.5502253702511266e-07,
"logits/chosen": -1.1218750476837158,
"logits/rejected": -1.118749976158142,
"logps/chosen": -419.0874938964844,
"logps/rejected": -581.5999755859375,
"loss": 0.0174,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.750048637390137,
"rewards/margins": 17.667186737060547,
"rewards/rejected": -24.440624237060547,
"step": 5250
},
{
"epoch": 3.3849372384937237,
"grad_norm": 0.03149535057004577,
"learning_rate": 1.5341274951706373e-07,
"logits/chosen": -1.111108422279358,
"logits/rejected": -1.144677758216858,
"logps/chosen": -461.375,
"logps/rejected": -606.0999755859375,
"loss": 0.0216,
"rewards/accuracies": 0.96875,
"rewards/chosen": -6.674023628234863,
"rewards/margins": 17.876562118530273,
"rewards/rejected": -24.568750381469727,
"step": 5260
},
{
"epoch": 3.3913743160605083,
"grad_norm": 0.010542321081653615,
"learning_rate": 1.518029620090148e-07,
"logits/chosen": -1.197851538658142,
"logits/rejected": -1.2239258289337158,
"logps/chosen": -411.45001220703125,
"logps/rejected": -562.6500244140625,
"loss": 0.0107,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.745898246765137,
"rewards/margins": 19.893749237060547,
"rewards/rejected": -25.65625,
"step": 5270
},
{
"epoch": 3.3978113936272933,
"grad_norm": 0.009674870957905443,
"learning_rate": 1.5019317450096585e-07,
"logits/chosen": -1.1496093273162842,
"logits/rejected": -1.172216773033142,
"logps/chosen": -393.3374938964844,
"logps/rejected": -585.4500122070312,
"loss": 0.0153,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.639721870422363,
"rewards/margins": 18.8828125,
"rewards/rejected": -24.532812118530273,
"step": 5280
},
{
"epoch": 3.404248471194078,
"grad_norm": 0.03660607691936547,
"learning_rate": 1.4858338699291693e-07,
"logits/chosen": -1.12353515625,
"logits/rejected": -1.0983397960662842,
"logps/chosen": -398.54998779296875,
"logps/rejected": -549.8499755859375,
"loss": 0.0135,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.693066596984863,
"rewards/margins": 18.256250381469727,
"rewards/rejected": -23.946874618530273,
"step": 5290
},
{
"epoch": 3.4106855487608625,
"grad_norm": 0.0018207283503531464,
"learning_rate": 1.4697359948486797e-07,
"logits/chosen": -1.1821777820587158,
"logits/rejected": -1.2270019054412842,
"logps/chosen": -451.57501220703125,
"logps/rejected": -590.9500122070312,
"loss": 0.0045,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.689355373382568,
"rewards/margins": 20.020313262939453,
"rewards/rejected": -25.712499618530273,
"step": 5300
},
{
"epoch": 3.417122626327647,
"grad_norm": 0.013680348716149777,
"learning_rate": 1.4536381197681905e-07,
"logits/chosen": -1.1581542491912842,
"logits/rejected": -1.185937523841858,
"logps/chosen": -468.75,
"logps/rejected": -631.25,
"loss": 0.0002,
"rewards/accuracies": 1.0,
"rewards/chosen": -6.91015625,
"rewards/margins": 17.759374618530273,
"rewards/rejected": -24.668750762939453,
"step": 5310
},
{
"epoch": 3.423559703894432,
"grad_norm": 0.9264470620519801,
"learning_rate": 1.437540244687701e-07,
"logits/chosen": -1.13616943359375,
"logits/rejected": -1.133520483970642,
"logps/chosen": -420.3999938964844,
"logps/rejected": -594.5999755859375,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.451952934265137,
"rewards/margins": 19.596874237060547,
"rewards/rejected": -26.049999237060547,
"step": 5320
},
{
"epoch": 3.4299967814612167,
"grad_norm": 0.0014284653419422593,
"learning_rate": 1.4214423696072117e-07,
"logits/chosen": -1.182226538658142,
"logits/rejected": -1.187597632408142,
"logps/chosen": -430.0,
"logps/rejected": -622.7000122070312,
"loss": 0.0051,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.946875095367432,
"rewards/margins": 20.178125381469727,
"rewards/rejected": -26.125,
"step": 5330
},
{
"epoch": 3.4364338590280012,
"grad_norm": 0.016144057920363487,
"learning_rate": 1.4053444945267224e-07,
"logits/chosen": -1.2000000476837158,
"logits/rejected": -1.2268555164337158,
"logps/chosen": -426.4750061035156,
"logps/rejected": -583.9000244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.616894721984863,
"rewards/margins": 18.295312881469727,
"rewards/rejected": -23.901561737060547,
"step": 5340
},
{
"epoch": 3.442870936594786,
"grad_norm": 0.002661825772172003,
"learning_rate": 1.389246619446233e-07,
"logits/chosen": -1.1572754383087158,
"logits/rejected": -1.1572754383087158,
"logps/chosen": -408.67498779296875,
"logps/rejected": -589.7999877929688,
"loss": 0.0177,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.3740234375,
"rewards/margins": 18.325000762939453,
"rewards/rejected": -24.712499618530273,
"step": 5350
},
{
"epoch": 3.449308014161571,
"grad_norm": 0.17931528592870347,
"learning_rate": 1.3731487443657436e-07,
"logits/chosen": -1.0957763195037842,
"logits/rejected": -1.1067383289337158,
"logps/chosen": -425.45001220703125,
"logps/rejected": -586.2000122070312,
"loss": 0.026,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -6.767773628234863,
"rewards/margins": 17.924999237060547,
"rewards/rejected": -24.690624237060547,
"step": 5360
},
{
"epoch": 3.4557450917283554,
"grad_norm": 0.00752747415982439,
"learning_rate": 1.357050869285254e-07,
"logits/chosen": -1.0899658203125,
"logits/rejected": -1.118408203125,
"logps/chosen": -446.88751220703125,
"logps/rejected": -618.4000244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.139916896820068,
"rewards/margins": 19.3515625,
"rewards/rejected": -25.503124237060547,
"step": 5370
},
{
"epoch": 3.46218216929514,
"grad_norm": 0.017031868523837528,
"learning_rate": 1.3409529942047648e-07,
"logits/chosen": -1.152441382408142,
"logits/rejected": -1.169335961341858,
"logps/chosen": -466.92498779296875,
"logps/rejected": -623.4000244140625,
"loss": 0.0088,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.587695121765137,
"rewards/margins": 18.764062881469727,
"rewards/rejected": -25.3515625,
"step": 5380
},
{
"epoch": 3.4686192468619246,
"grad_norm": 0.001165475350785279,
"learning_rate": 1.3248551191242756e-07,
"logits/chosen": -1.215234398841858,
"logits/rejected": -1.2233397960662842,
"logps/chosen": -442.29998779296875,
"logps/rejected": -611.2000122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.246972560882568,
"rewards/margins": 18.779687881469727,
"rewards/rejected": -25.021875381469727,
"step": 5390
},
{
"epoch": 3.475056324428709,
"grad_norm": 0.005232958057430995,
"learning_rate": 1.308757244043786e-07,
"logits/chosen": -1.1653320789337158,
"logits/rejected": -1.1648437976837158,
"logps/chosen": -410.17498779296875,
"logps/rejected": -596.4500122070312,
"loss": 0.0134,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.278515815734863,
"rewards/margins": 17.900781631469727,
"rewards/rejected": -24.192188262939453,
"step": 5400
},
{
"epoch": 3.481493401995494,
"grad_norm": 0.012513547122515394,
"learning_rate": 1.2926593689632968e-07,
"logits/chosen": -1.149658203125,
"logits/rejected": -1.196874976158142,
"logps/chosen": -399.11248779296875,
"logps/rejected": -591.7249755859375,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.450390815734863,
"rewards/margins": 19.028125762939453,
"rewards/rejected": -25.479686737060547,
"step": 5410
},
{
"epoch": 3.4879304795622788,
"grad_norm": 0.020245274961717487,
"learning_rate": 1.2765614938828072e-07,
"logits/chosen": -1.2703125476837158,
"logits/rejected": -1.290917992591858,
"logps/chosen": -479.1000061035156,
"logps/rejected": -626.1500244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -7.063818454742432,
"rewards/margins": 20.067188262939453,
"rewards/rejected": -27.118749618530273,
"step": 5420
},
{
"epoch": 3.4943675571290633,
"grad_norm": 0.017114813119376918,
"learning_rate": 1.260463618802318e-07,
"logits/chosen": -1.210693359375,
"logits/rejected": -1.2346680164337158,
"logps/chosen": -458.2250061035156,
"logps/rejected": -611.75,
"loss": 0.0261,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -6.143652439117432,
"rewards/margins": 19.665624618530273,
"rewards/rejected": -25.8125,
"step": 5430
},
{
"epoch": 3.5008046346958483,
"grad_norm": 0.018696061591920828,
"learning_rate": 1.2443657437218287e-07,
"logits/chosen": -1.2316405773162842,
"logits/rejected": -1.231054663658142,
"logps/chosen": -460.2749938964844,
"logps/rejected": -670.75,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.941992282867432,
"rewards/margins": 20.125,
"rewards/rejected": -27.071874618530273,
"step": 5440
},
{
"epoch": 3.507241712262633,
"grad_norm": 0.9238072536774803,
"learning_rate": 1.2282678686413394e-07,
"logits/chosen": -1.198486328125,
"logits/rejected": -1.195947289466858,
"logps/chosen": -401.70001220703125,
"logps/rejected": -588.2999877929688,
"loss": 0.0091,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.305371284484863,
"rewards/margins": 20.212499618530273,
"rewards/rejected": -26.515625,
"step": 5450
},
{
"epoch": 3.5136787898294175,
"grad_norm": 0.059459388376309825,
"learning_rate": 1.21216999356085e-07,
"logits/chosen": -1.1687500476837158,
"logits/rejected": -1.204199194908142,
"logps/chosen": -428.75,
"logps/rejected": -604.9500122070312,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.602441310882568,
"rewards/margins": 19.134374618530273,
"rewards/rejected": -25.737499237060547,
"step": 5460
},
{
"epoch": 3.520115867396202,
"grad_norm": 0.27459831092472686,
"learning_rate": 1.1960721184803606e-07,
"logits/chosen": -1.142822265625,
"logits/rejected": -1.189208984375,
"logps/chosen": -410.29998779296875,
"logps/rejected": -570.4000244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -7.4951171875,
"rewards/margins": 18.196874618530273,
"rewards/rejected": -25.700000762939453,
"step": 5470
},
{
"epoch": 3.5265529449629867,
"grad_norm": 0.009273735594422142,
"learning_rate": 1.1799742433998712e-07,
"logits/chosen": -1.131933569908142,
"logits/rejected": -1.1398437023162842,
"logps/chosen": -420.9375,
"logps/rejected": -592.5999755859375,
"loss": 0.0216,
"rewards/accuracies": 0.96875,
"rewards/chosen": -6.311841011047363,
"rewards/margins": 18.828125,
"rewards/rejected": -25.142187118530273,
"step": 5480
},
{
"epoch": 3.5329900225297717,
"grad_norm": 0.0528647089110024,
"learning_rate": 1.1638763683193818e-07,
"logits/chosen": -1.117700219154358,
"logits/rejected": -1.1470947265625,
"logps/chosen": -438.29998779296875,
"logps/rejected": -586.5999755859375,
"loss": 0.0153,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.416796684265137,
"rewards/margins": 19.087499618530273,
"rewards/rejected": -25.515625,
"step": 5490
},
{
"epoch": 3.5394271000965563,
"grad_norm": 0.055401282213416295,
"learning_rate": 1.1477784932388924e-07,
"logits/chosen": -1.223168969154358,
"logits/rejected": -1.2292969226837158,
"logps/chosen": -404.4125061035156,
"logps/rejected": -573.75,
"loss": 0.0132,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -7.193163871765137,
"rewards/margins": 18.621875762939453,
"rewards/rejected": -25.798437118530273,
"step": 5500
},
{
"epoch": 3.545864177663341,
"grad_norm": 0.002659691570256985,
"learning_rate": 1.131680618158403e-07,
"logits/chosen": -1.1658203601837158,
"logits/rejected": -1.186425805091858,
"logps/chosen": -443.2250061035156,
"logps/rejected": -587.3499755859375,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.725976467132568,
"rewards/margins": 18.939062118530273,
"rewards/rejected": -24.674999237060547,
"step": 5510
},
{
"epoch": 3.5523012552301254,
"grad_norm": 0.014521885488236713,
"learning_rate": 1.1155827430779136e-07,
"logits/chosen": -1.2326171398162842,
"logits/rejected": -1.237036108970642,
"logps/chosen": -446.38751220703125,
"logps/rejected": -592.9500122070312,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.961035251617432,
"rewards/margins": 18.581249237060547,
"rewards/rejected": -24.543750762939453,
"step": 5520
},
{
"epoch": 3.55873833279691,
"grad_norm": 0.025977628087194685,
"learning_rate": 1.0994848679974244e-07,
"logits/chosen": -1.169042944908142,
"logits/rejected": -1.169335961341858,
"logps/chosen": -384.70001220703125,
"logps/rejected": -554.3499755859375,
"loss": 0.0131,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.560546875,
"rewards/margins": 18.770313262939453,
"rewards/rejected": -24.334375381469727,
"step": 5530
},
{
"epoch": 3.565175410363695,
"grad_norm": 0.0046389029281187245,
"learning_rate": 1.083386992916935e-07,
"logits/chosen": -1.123803734779358,
"logits/rejected": -1.149511694908142,
"logps/chosen": -401.0249938964844,
"logps/rejected": -595.0,
"loss": 0.0163,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.404040336608887,
"rewards/margins": 20.435937881469727,
"rewards/rejected": -26.846874237060547,
"step": 5540
},
{
"epoch": 3.5716124879304796,
"grad_norm": 0.017966434361620324,
"learning_rate": 1.0672891178364456e-07,
"logits/chosen": -1.214257836341858,
"logits/rejected": -1.2414062023162842,
"logps/chosen": -414.375,
"logps/rejected": -604.8499755859375,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.5302734375,
"rewards/margins": 18.482812881469727,
"rewards/rejected": -25.018749237060547,
"step": 5550
},
{
"epoch": 3.578049565497264,
"grad_norm": 0.014762859371399277,
"learning_rate": 1.0511912427559562e-07,
"logits/chosen": -1.200341820716858,
"logits/rejected": -1.205175757408142,
"logps/chosen": -407.8500061035156,
"logps/rejected": -590.7000122070312,
"loss": 0.0141,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.133984565734863,
"rewards/margins": 18.453125,
"rewards/rejected": -23.579687118530273,
"step": 5560
},
{
"epoch": 3.584486643064049,
"grad_norm": 0.344430572394362,
"learning_rate": 1.0350933676754668e-07,
"logits/chosen": -1.171777367591858,
"logits/rejected": -1.159082055091858,
"logps/chosen": -397.9750061035156,
"logps/rejected": -590.5999755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.848437309265137,
"rewards/margins": 18.840625762939453,
"rewards/rejected": -24.703125,
"step": 5570
},
{
"epoch": 3.5909237206308338,
"grad_norm": 0.009410808435903622,
"learning_rate": 1.0189954925949774e-07,
"logits/chosen": -1.302636742591858,
"logits/rejected": -1.300878882408142,
"logps/chosen": -390.6499938964844,
"logps/rejected": -587.9500122070312,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.140234470367432,
"rewards/margins": 18.835155487060547,
"rewards/rejected": -24.9765625,
"step": 5580
},
{
"epoch": 3.5973607981976183,
"grad_norm": 0.47452165527225904,
"learning_rate": 1.0028976175144881e-07,
"logits/chosen": -1.177978515625,
"logits/rejected": -1.1656982898712158,
"logps/chosen": -415.0,
"logps/rejected": -600.7999877929688,
"loss": 0.0133,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.214453220367432,
"rewards/margins": 19.087499618530273,
"rewards/rejected": -25.3125,
"step": 5590
},
{
"epoch": 3.603797875764403,
"grad_norm": 0.05161000381239699,
"learning_rate": 9.867997424339987e-08,
"logits/chosen": -1.251953125,
"logits/rejected": -1.2570312023162842,
"logps/chosen": -446.625,
"logps/rejected": -611.25,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.92431640625,
"rewards/margins": 18.439062118530273,
"rewards/rejected": -24.360937118530273,
"step": 5600
},
{
"epoch": 3.6102349533311875,
"grad_norm": 0.009289587395709877,
"learning_rate": 9.707018673535093e-08,
"logits/chosen": -1.2129395008087158,
"logits/rejected": -1.230371117591858,
"logps/chosen": -432.8500061035156,
"logps/rejected": -588.7999877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.639208793640137,
"rewards/margins": 18.514062881469727,
"rewards/rejected": -24.134374618530273,
"step": 5610
},
{
"epoch": 3.6166720308979725,
"grad_norm": 0.011055816630815653,
"learning_rate": 9.5460399227302e-08,
"logits/chosen": -1.1920287609100342,
"logits/rejected": -1.178613305091858,
"logps/chosen": -444.6499938964844,
"logps/rejected": -599.0,
"loss": 0.0216,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.476122856140137,
"rewards/margins": 18.553125381469727,
"rewards/rejected": -24.029687881469727,
"step": 5620
},
{
"epoch": 3.623109108464757,
"grad_norm": 0.561158217771827,
"learning_rate": 9.385061171925305e-08,
"logits/chosen": -1.147802710533142,
"logits/rejected": -1.180761694908142,
"logps/chosen": -487.7250061035156,
"logps/rejected": -629.0999755859375,
"loss": 0.0132,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.1337890625,
"rewards/margins": 18.4140625,
"rewards/rejected": -24.549999237060547,
"step": 5630
},
{
"epoch": 3.6295461860315417,
"grad_norm": 0.09391178158930319,
"learning_rate": 9.224082421120411e-08,
"logits/chosen": -1.2050292491912842,
"logits/rejected": -1.23583984375,
"logps/chosen": -410.8999938964844,
"logps/rejected": -601.0999755859375,
"loss": 0.0303,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -5.978369235992432,
"rewards/margins": 19.447656631469727,
"rewards/rejected": -25.4296875,
"step": 5640
},
{
"epoch": 3.6359832635983262,
"grad_norm": 0.005353638341178634,
"learning_rate": 9.063103670315519e-08,
"logits/chosen": -1.254248023033142,
"logits/rejected": -1.2638671398162842,
"logps/chosen": -437.1875,
"logps/rejected": -608.2000122070312,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.216015815734863,
"rewards/margins": 18.854686737060547,
"rewards/rejected": -24.067188262939453,
"step": 5650
},
{
"epoch": 3.642420341165111,
"grad_norm": 0.0796077309007433,
"learning_rate": 8.902124919510625e-08,
"logits/chosen": -1.177978515625,
"logits/rejected": -1.2056152820587158,
"logps/chosen": -475.1499938964844,
"logps/rejected": -607.5,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.043749809265137,
"rewards/margins": 19.282812118530273,
"rewards/rejected": -25.309375762939453,
"step": 5660
},
{
"epoch": 3.648857418731896,
"grad_norm": 0.00354886488066356,
"learning_rate": 8.741146168705731e-08,
"logits/chosen": -1.2111327648162842,
"logits/rejected": -1.214453101158142,
"logps/chosen": -421.1499938964844,
"logps/rejected": -611.0999755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.758008003234863,
"rewards/margins": 19.325000762939453,
"rewards/rejected": -25.079687118530273,
"step": 5670
},
{
"epoch": 3.6552944962986804,
"grad_norm": 0.011692323247531729,
"learning_rate": 8.580167417900837e-08,
"logits/chosen": -1.193945288658142,
"logits/rejected": -1.203710913658142,
"logps/chosen": -440.8999938964844,
"logps/rejected": -606.0,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.059960842132568,
"rewards/margins": 18.110937118530273,
"rewards/rejected": -24.171875,
"step": 5680
},
{
"epoch": 3.661731573865465,
"grad_norm": 0.0032497001850268115,
"learning_rate": 8.419188667095943e-08,
"logits/chosen": -1.242285132408142,
"logits/rejected": -1.253173828125,
"logps/chosen": -448.1000061035156,
"logps/rejected": -609.4000244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.205370903015137,
"rewards/margins": 19.162500381469727,
"rewards/rejected": -25.389062881469727,
"step": 5690
},
{
"epoch": 3.66816865143225,
"grad_norm": 0.021910077756192244,
"learning_rate": 8.258209916291049e-08,
"logits/chosen": -1.19921875,
"logits/rejected": -1.2140624523162842,
"logps/chosen": -414.42498779296875,
"logps/rejected": -615.6500244140625,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.513964653015137,
"rewards/margins": 19.879688262939453,
"rewards/rejected": -26.390625,
"step": 5700
},
{
"epoch": 3.6746057289990346,
"grad_norm": 0.028081385474183675,
"learning_rate": 8.097231165486156e-08,
"logits/chosen": -1.206298828125,
"logits/rejected": -1.247802734375,
"logps/chosen": -469.45001220703125,
"logps/rejected": -612.3499755859375,
"loss": 0.0044,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.853906154632568,
"rewards/margins": 18.9140625,
"rewards/rejected": -24.764062881469727,
"step": 5710
},
{
"epoch": 3.681042806565819,
"grad_norm": 0.009291367600511937,
"learning_rate": 7.936252414681262e-08,
"logits/chosen": -1.1588866710662842,
"logits/rejected": -1.1977050304412842,
"logps/chosen": -427.6000061035156,
"logps/rejected": -570.5499877929688,
"loss": 0.0174,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.973535060882568,
"rewards/margins": 18.046875,
"rewards/rejected": -24.015625,
"step": 5720
},
{
"epoch": 3.6874798841326037,
"grad_norm": 1.0300650774799196,
"learning_rate": 7.775273663876368e-08,
"logits/chosen": -1.214990258216858,
"logits/rejected": -1.264257788658142,
"logps/chosen": -436.8999938964844,
"logps/rejected": -600.75,
"loss": 0.0086,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.286913871765137,
"rewards/margins": 19.489063262939453,
"rewards/rejected": -25.778125762939453,
"step": 5730
},
{
"epoch": 3.6939169616993883,
"grad_norm": 0.1391319359241606,
"learning_rate": 7.614294913071474e-08,
"logits/chosen": -1.2268555164337158,
"logits/rejected": -1.248144507408142,
"logps/chosen": -445.8500061035156,
"logps/rejected": -629.2999877929688,
"loss": 0.0259,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -6.4736328125,
"rewards/margins": 19.696874618530273,
"rewards/rejected": -26.178125381469727,
"step": 5740
},
{
"epoch": 3.7003540392661733,
"grad_norm": 0.36740609289586745,
"learning_rate": 7.45331616226658e-08,
"logits/chosen": -1.179589867591858,
"logits/rejected": -1.18310546875,
"logps/chosen": -397.2250061035156,
"logps/rejected": -576.75,
"loss": 0.0217,
"rewards/accuracies": 0.96875,
"rewards/chosen": -6.327441215515137,
"rewards/margins": 18.165624618530273,
"rewards/rejected": -24.484375,
"step": 5750
},
{
"epoch": 3.706791116832958,
"grad_norm": 1.4062043903030401,
"learning_rate": 7.292337411461686e-08,
"logits/chosen": -1.1822540760040283,
"logits/rejected": -1.2383301258087158,
"logps/chosen": -418.6499938964844,
"logps/rejected": -598.6500244140625,
"loss": 0.0046,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.955420017242432,
"rewards/margins": 19.715625762939453,
"rewards/rejected": -25.673437118530273,
"step": 5760
},
{
"epoch": 3.7132281943997425,
"grad_norm": 0.010906458911690259,
"learning_rate": 7.131358660656794e-08,
"logits/chosen": -1.23486328125,
"logits/rejected": -1.24169921875,
"logps/chosen": -412.95001220703125,
"logps/rejected": -583.5499877929688,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -7.052734375,
"rewards/margins": 18.771875381469727,
"rewards/rejected": -25.815624237060547,
"step": 5770
},
{
"epoch": 3.719665271966527,
"grad_norm": 0.4194311473667511,
"learning_rate": 6.9703799098519e-08,
"logits/chosen": -1.142797827720642,
"logits/rejected": -1.152197241783142,
"logps/chosen": -451.17498779296875,
"logps/rejected": -613.25,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.297070503234863,
"rewards/margins": 18.793750762939453,
"rewards/rejected": -25.09375,
"step": 5780
},
{
"epoch": 3.7261023495333117,
"grad_norm": 0.14153168186128046,
"learning_rate": 6.809401159047006e-08,
"logits/chosen": -1.154870629310608,
"logits/rejected": -1.183935523033142,
"logps/chosen": -441.25,
"logps/rejected": -601.25,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.050488471984863,
"rewards/margins": 19.293750762939453,
"rewards/rejected": -25.354686737060547,
"step": 5790
},
{
"epoch": 3.7325394271000967,
"grad_norm": 0.31575897374121853,
"learning_rate": 6.648422408242112e-08,
"logits/chosen": -1.235742211341858,
"logits/rejected": -1.2470214366912842,
"logps/chosen": -438.8500061035156,
"logps/rejected": -564.3499755859375,
"loss": 0.0047,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.980322360992432,
"rewards/margins": 18.651561737060547,
"rewards/rejected": -24.625,
"step": 5800
},
{
"epoch": 3.7389765046668813,
"grad_norm": 0.06287240602018677,
"learning_rate": 6.487443657437218e-08,
"logits/chosen": -1.195947289466858,
"logits/rejected": -1.205468773841858,
"logps/chosen": -417.57501220703125,
"logps/rejected": -602.0999755859375,
"loss": 0.0196,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.490429878234863,
"rewards/margins": 18.731250762939453,
"rewards/rejected": -24.228124618530273,
"step": 5810
},
{
"epoch": 3.745413582233666,
"grad_norm": 0.0005135924625372928,
"learning_rate": 6.326464906632324e-08,
"logits/chosen": -1.2028687000274658,
"logits/rejected": -1.223486304283142,
"logps/chosen": -466.2749938964844,
"logps/rejected": -638.0999755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.878710746765137,
"rewards/margins": 20.1484375,
"rewards/rejected": -26.024999618530273,
"step": 5820
},
{
"epoch": 3.751850659800451,
"grad_norm": 0.03898064290236112,
"learning_rate": 6.165486155827431e-08,
"logits/chosen": -1.201318383216858,
"logits/rejected": -1.215429663658142,
"logps/chosen": -429.57501220703125,
"logps/rejected": -586.4500122070312,
"loss": 0.018,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.779492378234863,
"rewards/margins": 19.001562118530273,
"rewards/rejected": -24.768749237060547,
"step": 5830
},
{
"epoch": 3.7582877373672354,
"grad_norm": 0.013577934214215267,
"learning_rate": 6.004507405022537e-08,
"logits/chosen": -1.228417992591858,
"logits/rejected": -1.2648437023162842,
"logps/chosen": -484.8999938964844,
"logps/rejected": -625.7999877929688,
"loss": 0.005,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -5.214037895202637,
"rewards/margins": 19.340625762939453,
"rewards/rejected": -24.549999237060547,
"step": 5840
},
{
"epoch": 3.76472481493402,
"grad_norm": 0.016377009732415706,
"learning_rate": 5.843528654217643e-08,
"logits/chosen": -1.1907227039337158,
"logits/rejected": -1.204492211341858,
"logps/chosen": -413.07501220703125,
"logps/rejected": -563.0999755859375,
"loss": 0.009,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.839453220367432,
"rewards/margins": 17.390625,
"rewards/rejected": -23.234375,
"step": 5850
},
{
"epoch": 3.7711618925008046,
"grad_norm": 0.015952358445255128,
"learning_rate": 5.682549903412749e-08,
"logits/chosen": -1.08544921875,
"logits/rejected": -1.106835961341858,
"logps/chosen": -406.57501220703125,
"logps/rejected": -596.4000244140625,
"loss": 0.0217,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.909936428070068,
"rewards/margins": 19.125,
"rewards/rejected": -25.037500381469727,
"step": 5860
},
{
"epoch": 3.777598970067589,
"grad_norm": 0.006201655476189211,
"learning_rate": 5.521571152607855e-08,
"logits/chosen": -1.1427733898162842,
"logits/rejected": -1.167578101158142,
"logps/chosen": -459.1000061035156,
"logps/rejected": -633.2999877929688,
"loss": 0.0217,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.592871189117432,
"rewards/margins": 20.014062881469727,
"rewards/rejected": -25.606250762939453,
"step": 5870
},
{
"epoch": 3.784036047634374,
"grad_norm": 0.009195903984204546,
"learning_rate": 5.360592401802962e-08,
"logits/chosen": -1.1323730945587158,
"logits/rejected": -1.120214819908142,
"logps/chosen": -447.07501220703125,
"logps/rejected": -620.5999755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.411718845367432,
"rewards/margins": 19.521875381469727,
"rewards/rejected": -25.934375762939453,
"step": 5880
},
{
"epoch": 3.7904731252011588,
"grad_norm": 6.727471051585618,
"learning_rate": 5.199613650998068e-08,
"logits/chosen": -1.192773461341858,
"logits/rejected": -1.21337890625,
"logps/chosen": -386.1499938964844,
"logps/rejected": -546.25,
"loss": 0.0133,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.852783203125,
"rewards/margins": 18.420312881469727,
"rewards/rejected": -24.274999618530273,
"step": 5890
},
{
"epoch": 3.7969102027679433,
"grad_norm": 0.02099655547602189,
"learning_rate": 5.038634900193174e-08,
"logits/chosen": -1.214257836341858,
"logits/rejected": -1.22705078125,
"logps/chosen": -445.125,
"logps/rejected": -612.5,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.768261909484863,
"rewards/margins": 17.332813262939453,
"rewards/rejected": -23.095312118530273,
"step": 5900
},
{
"epoch": 3.803347280334728,
"grad_norm": 0.004007814604864058,
"learning_rate": 4.8776561493882806e-08,
"logits/chosen": -1.2330811023712158,
"logits/rejected": -1.25048828125,
"logps/chosen": -476.54998779296875,
"logps/rejected": -619.9000244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.557909965515137,
"rewards/margins": 18.684375762939453,
"rewards/rejected": -25.256250381469727,
"step": 5910
},
{
"epoch": 3.8097843579015125,
"grad_norm": 0.16369300391096503,
"learning_rate": 4.7166773985833866e-08,
"logits/chosen": -1.169335961341858,
"logits/rejected": -1.1863281726837158,
"logps/chosen": -452.32501220703125,
"logps/rejected": -593.3250122070312,
"loss": 0.0228,
"rewards/accuracies": 0.96875,
"rewards/chosen": -6.1298828125,
"rewards/margins": 18.404687881469727,
"rewards/rejected": -24.515625,
"step": 5920
},
{
"epoch": 3.8162214354682975,
"grad_norm": 0.00922647797366643,
"learning_rate": 4.5556986477784926e-08,
"logits/chosen": -1.1843993663787842,
"logits/rejected": -1.206201195716858,
"logps/chosen": -441.1499938964844,
"logps/rejected": -621.0999755859375,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.243261814117432,
"rewards/margins": 19.825000762939453,
"rewards/rejected": -25.057811737060547,
"step": 5930
},
{
"epoch": 3.822658513035082,
"grad_norm": 0.013267277094511646,
"learning_rate": 4.394719896973599e-08,
"logits/chosen": -1.101464867591858,
"logits/rejected": -1.147607445716858,
"logps/chosen": -440.5249938964844,
"logps/rejected": -587.0999755859375,
"loss": 0.0303,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -5.225390434265137,
"rewards/margins": 18.484375,
"rewards/rejected": -23.71875,
"step": 5940
},
{
"epoch": 3.8290955906018667,
"grad_norm": 0.09662645701310577,
"learning_rate": 4.233741146168705e-08,
"logits/chosen": -1.1639404296875,
"logits/rejected": -1.1750977039337158,
"logps/chosen": -431.9750061035156,
"logps/rejected": -587.3499755859375,
"loss": 0.0259,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": -5.033447265625,
"rewards/margins": 19.165624618530273,
"rewards/rejected": -24.212499618530273,
"step": 5950
},
{
"epoch": 3.8355326681686517,
"grad_norm": 0.008851252217354692,
"learning_rate": 4.072762395363811e-08,
"logits/chosen": -1.260156273841858,
"logits/rejected": -1.277929663658142,
"logps/chosen": -436.2250061035156,
"logps/rejected": -586.7999877929688,
"loss": 0.0086,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.388281345367432,
"rewards/margins": 18.201562881469727,
"rewards/rejected": -24.606250762939453,
"step": 5960
},
{
"epoch": 3.8419697457354363,
"grad_norm": 0.0248495029820189,
"learning_rate": 3.911783644558918e-08,
"logits/chosen": -1.160009741783142,
"logits/rejected": -1.194433569908142,
"logps/chosen": -444.6000061035156,
"logps/rejected": -621.7000122070312,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.681836128234863,
"rewards/margins": 19.104686737060547,
"rewards/rejected": -24.806249618530273,
"step": 5970
},
{
"epoch": 3.848406823302221,
"grad_norm": 0.03249204827309899,
"learning_rate": 3.750804893754024e-08,
"logits/chosen": -1.224755883216858,
"logits/rejected": -1.24853515625,
"logps/chosen": -451.82501220703125,
"logps/rejected": -622.8499755859375,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.946679592132568,
"rewards/margins": 19.3359375,
"rewards/rejected": -25.296875,
"step": 5980
},
{
"epoch": 3.8548439008690054,
"grad_norm": 0.0045911375877971785,
"learning_rate": 3.58982614294913e-08,
"logits/chosen": -1.176025390625,
"logits/rejected": -1.178564429283142,
"logps/chosen": -412.375,
"logps/rejected": -592.3499755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.462890625,
"rewards/margins": 18.596874237060547,
"rewards/rejected": -24.068750381469727,
"step": 5990
},
{
"epoch": 3.86128097843579,
"grad_norm": 0.022481239633330877,
"learning_rate": 3.428847392144237e-08,
"logits/chosen": -1.226953148841858,
"logits/rejected": -1.242822289466858,
"logps/chosen": -441.20001220703125,
"logps/rejected": -612.3499755859375,
"loss": 0.0043,
"rewards/accuracies": 0.9937499761581421,
"rewards/chosen": -6.344152927398682,
"rewards/margins": 18.314062118530273,
"rewards/rejected": -24.653125762939453,
"step": 6000
},
{
"epoch": 3.867718056002575,
"grad_norm": 0.007146640596074133,
"learning_rate": 3.267868641339343e-08,
"logits/chosen": -1.117163062095642,
"logits/rejected": -1.1201903820037842,
"logps/chosen": -428.3125,
"logps/rejected": -588.6500244140625,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.737353324890137,
"rewards/margins": 18.498437881469727,
"rewards/rejected": -24.25,
"step": 6010
},
{
"epoch": 3.8741551335693596,
"grad_norm": 0.007787262767055397,
"learning_rate": 3.1068898905344494e-08,
"logits/chosen": -1.100195288658142,
"logits/rejected": -1.133642554283142,
"logps/chosen": -393.17498779296875,
"logps/rejected": -556.2000122070312,
"loss": 0.0217,
"rewards/accuracies": 0.96875,
"rewards/chosen": -6.217382907867432,
"rewards/margins": 17.943750381469727,
"rewards/rejected": -24.15625,
"step": 6020
},
{
"epoch": 3.880592211136144,
"grad_norm": 0.02099978633163225,
"learning_rate": 2.9459111397295555e-08,
"logits/chosen": -1.2048828601837158,
"logits/rejected": -1.2155272960662842,
"logps/chosen": -444.3500061035156,
"logps/rejected": -610.6500244140625,
"loss": 0.0218,
"rewards/accuracies": 0.96875,
"rewards/chosen": -6.603125095367432,
"rewards/margins": 19.350000381469727,
"rewards/rejected": -25.959375381469727,
"step": 6030
},
{
"epoch": 3.8870292887029287,
"grad_norm": 0.09482176849813918,
"learning_rate": 2.7849323889246618e-08,
"logits/chosen": -1.2528808116912842,
"logits/rejected": -1.2414062023162842,
"logps/chosen": -433.2250061035156,
"logps/rejected": -581.5999755859375,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.998827934265137,
"rewards/margins": 18.329687118530273,
"rewards/rejected": -24.332813262939453,
"step": 6040
},
{
"epoch": 3.8934663662697133,
"grad_norm": 0.8030153239793042,
"learning_rate": 2.623953638119768e-08,
"logits/chosen": -1.220117211341858,
"logits/rejected": -1.2244141101837158,
"logps/chosen": -459.1499938964844,
"logps/rejected": -607.8499755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.8914794921875,
"rewards/margins": 18.568750381469727,
"rewards/rejected": -24.464061737060547,
"step": 6050
},
{
"epoch": 3.8999034438364983,
"grad_norm": 1.5912180308467658,
"learning_rate": 2.4629748873148742e-08,
"logits/chosen": -1.1505858898162842,
"logits/rejected": -1.1716797351837158,
"logps/chosen": -406.6187438964844,
"logps/rejected": -567.1500244140625,
"loss": 0.0303,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": -5.146173000335693,
"rewards/margins": 19.529687881469727,
"rewards/rejected": -24.676563262939453,
"step": 6060
},
{
"epoch": 3.906340521403283,
"grad_norm": 0.0016637072817598324,
"learning_rate": 2.3019961365099805e-08,
"logits/chosen": -1.2268555164337158,
"logits/rejected": -1.233789086341858,
"logps/chosen": -451.6000061035156,
"logps/rejected": -651.7999877929688,
"loss": 0.0089,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.985547065734863,
"rewards/margins": 19.717187881469727,
"rewards/rejected": -25.6953125,
"step": 6070
},
{
"epoch": 3.9127775989700675,
"grad_norm": 0.007263086315974875,
"learning_rate": 2.141017385705087e-08,
"logits/chosen": -1.098291039466858,
"logits/rejected": -1.1204102039337158,
"logps/chosen": -413.7250061035156,
"logps/rejected": -584.9500122070312,
"loss": 0.0232,
"rewards/accuracies": 0.96875,
"rewards/chosen": -6.582226753234863,
"rewards/margins": 18.423437118530273,
"rewards/rejected": -25.003124237060547,
"step": 6080
},
{
"epoch": 3.9192146765368525,
"grad_norm": 0.005372894252220103,
"learning_rate": 1.980038634900193e-08,
"logits/chosen": -1.1232421398162842,
"logits/rejected": -1.110595703125,
"logps/chosen": -416.1000061035156,
"logps/rejected": -576.9500122070312,
"loss": 0.0216,
"rewards/accuracies": 0.96875,
"rewards/chosen": -5.376269340515137,
"rewards/margins": 19.579687118530273,
"rewards/rejected": -24.953125,
"step": 6090
},
{
"epoch": 3.925651754103637,
"grad_norm": 1.223081214457884,
"learning_rate": 1.8190598840952993e-08,
"logits/chosen": -1.138671875,
"logits/rejected": -1.160668969154358,
"logps/chosen": -426.2749938964844,
"logps/rejected": -576.2999877929688,
"loss": 0.0174,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.99658203125,
"rewards/margins": 19.203125,
"rewards/rejected": -25.189062118530273,
"step": 6100
},
{
"epoch": 3.9320888316704217,
"grad_norm": 0.24373284704903744,
"learning_rate": 1.6580811332904056e-08,
"logits/chosen": -1.2075684070587158,
"logits/rejected": -1.2453124523162842,
"logps/chosen": -456.2749938964844,
"logps/rejected": -626.9500122070312,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.045752048492432,
"rewards/margins": 19.284374237060547,
"rewards/rejected": -25.317188262939453,
"step": 6110
},
{
"epoch": 3.9385259092372062,
"grad_norm": 0.030940312380477432,
"learning_rate": 1.497102382485512e-08,
"logits/chosen": -1.2628905773162842,
"logits/rejected": -1.289648413658142,
"logps/chosen": -446.42498779296875,
"logps/rejected": -595.75,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -5.348242282867432,
"rewards/margins": 19.128124237060547,
"rewards/rejected": -24.459375381469727,
"step": 6120
},
{
"epoch": 3.944962986803991,
"grad_norm": 0.030722284899537575,
"learning_rate": 1.3361236316806181e-08,
"logits/chosen": -1.1930663585662842,
"logits/rejected": -1.2233397960662842,
"logps/chosen": -457.6000061035156,
"logps/rejected": -600.6500244140625,
"loss": 0.0011,
"rewards/accuracies": 1.0,
"rewards/chosen": -6.046191215515137,
"rewards/margins": 18.890625,
"rewards/rejected": -24.9375,
"step": 6130
},
{
"epoch": 3.951400064370776,
"grad_norm": 0.01006862708136734,
"learning_rate": 1.1751448808757243e-08,
"logits/chosen": -1.186792016029358,
"logits/rejected": -1.175756812095642,
"logps/chosen": -449.125,
"logps/rejected": -613.1500244140625,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.257226467132568,
"rewards/margins": 18.479686737060547,
"rewards/rejected": -24.739063262939453,
"step": 6140
},
{
"epoch": 3.9578371419375604,
"grad_norm": 0.0269485574039851,
"learning_rate": 1.0141661300708307e-08,
"logits/chosen": -1.1842772960662842,
"logits/rejected": -1.1896483898162842,
"logps/chosen": -394.6000061035156,
"logps/rejected": -543.3499755859375,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -6.286718845367432,
"rewards/margins": 17.590625762939453,
"rewards/rejected": -23.871875762939453,
"step": 6150
},
{
"epoch": 3.964274219504345,
"grad_norm": 0.015970088391158554,
"learning_rate": 8.531873792659369e-09,
"logits/chosen": -1.1664307117462158,
"logits/rejected": -1.1992676258087158,
"logps/chosen": -432.0,
"logps/rejected": -593.6500244140625,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.511328220367432,
"rewards/margins": 19.0390625,
"rewards/rejected": -24.556249618530273,
"step": 6160
},
{
"epoch": 3.9707112970711296,
"grad_norm": 0.06187758075741397,
"learning_rate": 6.922086284610431e-09,
"logits/chosen": -1.233984351158142,
"logits/rejected": -1.266992211341858,
"logps/chosen": -442.20001220703125,
"logps/rejected": -558.5499877929688,
"loss": 0.0173,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -5.187597751617432,
"rewards/margins": 18.693750381469727,
"rewards/rejected": -23.881250381469727,
"step": 6170
},
{
"epoch": 3.977148374637914,
"grad_norm": 0.25424001056387396,
"learning_rate": 5.312298776561494e-09,
"logits/chosen": -1.1482422351837158,
"logits/rejected": -1.1685059070587158,
"logps/chosen": -441.0249938964844,
"logps/rejected": -610.4000244140625,
"loss": 0.013,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.648241996765137,
"rewards/margins": 18.834375381469727,
"rewards/rejected": -25.481250762939453,
"step": 6180
},
{
"epoch": 3.983585452204699,
"grad_norm": 0.006728702542557314,
"learning_rate": 3.7025112685125563e-09,
"logits/chosen": -1.1803710460662842,
"logits/rejected": -1.1916015148162842,
"logps/chosen": -434.8999938964844,
"logps/rejected": -569.0499877929688,
"loss": 0.0087,
"rewards/accuracies": 0.987500011920929,
"rewards/chosen": -5.6787109375,
"rewards/margins": 19.334375381469727,
"rewards/rejected": -25.006250381469727,
"step": 6190
},
{
"epoch": 3.9900225297714838,
"grad_norm": 0.0492094714617133,
"learning_rate": 2.0927237604636186e-09,
"logits/chosen": -1.182037353515625,
"logits/rejected": -1.1907927989959717,
"logps/chosen": -433.1000061035156,
"logps/rejected": -609.4000244140625,
"loss": 0.0152,
"rewards/accuracies": 0.981249988079071,
"rewards/chosen": -6.009033203125,
"rewards/margins": 18.553125381469727,
"rewards/rejected": -24.575000762939453,
"step": 6200
},
{
"epoch": 3.9964596073382683,
"grad_norm": 0.025755020406968258,
"learning_rate": 4.829362524146813e-10,
"logits/chosen": -1.1433594226837158,
"logits/rejected": -1.1748046875,
"logps/chosen": -440.6499938964844,
"logps/rejected": -625.7999877929688,
"loss": 0.0186,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": -6.156201362609863,
"rewards/margins": 18.5078125,
"rewards/rejected": -24.65625,
"step": 6210
}
],
"logging_steps": 10,
"max_steps": 6212,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}