PEFT
Safetensors
openhermes-dpo-ckpt9k5 / trainer_state.json
banghua's picture
Upload folder using huggingface_hub
11dc5e1
Raw
History Blame
459 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.6640392362935716,
"eval_steps": 10000,
"global_step": 9500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0,
"learning_rate": 6.666666666666666e-10,
"logits/chosen": -2.8252084255218506,
"logits/rejected": -2.962496042251587,
"logps/chosen": -145.02584838867188,
"logps/rejected": -154.2101593017578,
"loss": 0.6931,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.0,
"learning_rate": 6.666666666666666e-09,
"logits/chosen": -2.758862018585205,
"logits/rejected": -2.733859062194824,
"logps/chosen": -232.04269409179688,
"logps/rejected": -191.10357666015625,
"loss": 0.693,
"rewards/accuracies": 0.4444444477558136,
"rewards/chosen": -0.0011513985227793455,
"rewards/margins": -0.001275173737667501,
"rewards/rejected": 0.00012377536040730774,
"step": 10
},
{
"epoch": 0.0,
"learning_rate": 1.3333333333333332e-08,
"logits/chosen": -2.7594728469848633,
"logits/rejected": -2.7667908668518066,
"logps/chosen": -246.5968780517578,
"logps/rejected": -213.8126678466797,
"loss": 0.6931,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": -0.0009503777837380767,
"rewards/margins": 0.00045707420213148,
"rewards/rejected": -0.0014074521604925394,
"step": 20
},
{
"epoch": 0.01,
"learning_rate": 2e-08,
"logits/chosen": -2.7216076850891113,
"logits/rejected": -2.7468366622924805,
"logps/chosen": -258.4103698730469,
"logps/rejected": -267.4147033691406,
"loss": 0.6937,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": -0.00010261923307552934,
"rewards/margins": -0.0023887469433248043,
"rewards/rejected": 0.002286128234118223,
"step": 30
},
{
"epoch": 0.01,
"learning_rate": 2.6666666666666664e-08,
"logits/chosen": -2.871617078781128,
"logits/rejected": -2.801084518432617,
"logps/chosen": -242.60867309570312,
"logps/rejected": -232.33499145507812,
"loss": 0.6928,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0018373109633103013,
"rewards/margins": 0.00041042696102522314,
"rewards/rejected": 0.0014268836239352822,
"step": 40
},
{
"epoch": 0.01,
"learning_rate": 3.333333333333333e-08,
"logits/chosen": -2.680046796798706,
"logits/rejected": -2.714757204055786,
"logps/chosen": -240.3429718017578,
"logps/rejected": -184.65933227539062,
"loss": 0.6932,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": -2.7602236514212564e-05,
"rewards/margins": 0.00031870920793153346,
"rewards/rejected": -0.0003463116008788347,
"step": 50
},
{
"epoch": 0.01,
"learning_rate": 4e-08,
"logits/chosen": -2.796433448791504,
"logits/rejected": -2.823643684387207,
"logps/chosen": -217.6321258544922,
"logps/rejected": -171.95498657226562,
"loss": 0.6931,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": -0.00015609370893798769,
"rewards/margins": 0.00023442933161277324,
"rewards/rejected": -0.00039052290958352387,
"step": 60
},
{
"epoch": 0.01,
"learning_rate": 4.666666666666667e-08,
"logits/chosen": -2.7592403888702393,
"logits/rejected": -2.7623109817504883,
"logps/chosen": -216.8944854736328,
"logps/rejected": -218.29275512695312,
"loss": 0.6928,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": -0.001479600090533495,
"rewards/margins": 0.00030887164757587016,
"rewards/rejected": -0.0017884715925902128,
"step": 70
},
{
"epoch": 0.01,
"learning_rate": 5.333333333333333e-08,
"logits/chosen": -2.6831583976745605,
"logits/rejected": -2.708047866821289,
"logps/chosen": -271.333984375,
"logps/rejected": -211.88742065429688,
"loss": 0.6931,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.001955702668055892,
"rewards/margins": 0.003820312675088644,
"rewards/rejected": -0.0018646096577867866,
"step": 80
},
{
"epoch": 0.02,
"learning_rate": 6e-08,
"logits/chosen": -2.7753825187683105,
"logits/rejected": -2.754791259765625,
"logps/chosen": -197.63711547851562,
"logps/rejected": -200.37274169921875,
"loss": 0.6933,
"rewards/accuracies": 0.32499998807907104,
"rewards/chosen": -0.001247849315404892,
"rewards/margins": -0.002036663005128503,
"rewards/rejected": 0.000788813573308289,
"step": 90
},
{
"epoch": 0.02,
"learning_rate": 6.666666666666665e-08,
"logits/chosen": -2.799436569213867,
"logits/rejected": -2.7348275184631348,
"logps/chosen": -273.90789794921875,
"logps/rejected": -223.2024383544922,
"loss": 0.6931,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.0007920874049887061,
"rewards/margins": -1.7427420971216634e-05,
"rewards/rejected": -0.000774660031311214,
"step": 100
},
{
"epoch": 0.02,
"learning_rate": 7.333333333333333e-08,
"logits/chosen": -2.702688217163086,
"logits/rejected": -2.7402188777923584,
"logps/chosen": -237.420654296875,
"logps/rejected": -176.0985870361328,
"loss": 0.693,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0006930113304406404,
"rewards/margins": 0.0016551170265302062,
"rewards/rejected": -0.0009621057542972267,
"step": 110
},
{
"epoch": 0.02,
"learning_rate": 8e-08,
"logits/chosen": -2.7931458950042725,
"logits/rejected": -2.732015371322632,
"logps/chosen": -234.2708282470703,
"logps/rejected": -191.72213745117188,
"loss": 0.6933,
"rewards/accuracies": 0.30000001192092896,
"rewards/chosen": -0.001032972359098494,
"rewards/margins": -0.0020988043397665024,
"rewards/rejected": 0.001065832213498652,
"step": 120
},
{
"epoch": 0.02,
"learning_rate": 8.666666666666666e-08,
"logits/chosen": -2.7383856773376465,
"logits/rejected": -2.778128147125244,
"logps/chosen": -236.73348999023438,
"logps/rejected": -212.9311065673828,
"loss": 0.6931,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.0009975699940696359,
"rewards/margins": -0.0017474631313234568,
"rewards/rejected": 0.0007498931954614818,
"step": 130
},
{
"epoch": 0.02,
"learning_rate": 9.333333333333334e-08,
"logits/chosen": -2.770118236541748,
"logits/rejected": -2.8189587593078613,
"logps/chosen": -242.80325317382812,
"logps/rejected": -248.46408081054688,
"loss": 0.6932,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": -0.001506878761574626,
"rewards/margins": -0.0005925501463934779,
"rewards/rejected": -0.0009143284405581653,
"step": 140
},
{
"epoch": 0.03,
"learning_rate": 1e-07,
"logits/chosen": -2.7896523475646973,
"logits/rejected": -2.8789305686950684,
"logps/chosen": -279.1468505859375,
"logps/rejected": -286.92449951171875,
"loss": 0.6932,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.001270245062187314,
"rewards/margins": 0.0007720521534793079,
"rewards/rejected": 0.0004981928505003452,
"step": 150
},
{
"epoch": 0.03,
"learning_rate": 9.994962216624685e-08,
"logits/chosen": -2.7570908069610596,
"logits/rejected": -2.7672576904296875,
"logps/chosen": -237.09164428710938,
"logps/rejected": -215.8179473876953,
"loss": 0.6935,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.0016938255866989493,
"rewards/margins": -0.00298044690862298,
"rewards/rejected": 0.0012866210890933871,
"step": 160
},
{
"epoch": 0.03,
"learning_rate": 9.989924433249369e-08,
"logits/chosen": -2.8499808311462402,
"logits/rejected": -2.8154406547546387,
"logps/chosen": -264.3780822753906,
"logps/rejected": -214.450439453125,
"loss": 0.6932,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.001735908561386168,
"rewards/margins": 0.001296285423450172,
"rewards/rejected": 0.00043962281779386103,
"step": 170
},
{
"epoch": 0.03,
"learning_rate": 9.984886649874054e-08,
"logits/chosen": -2.6970016956329346,
"logits/rejected": -2.7668747901916504,
"logps/chosen": -222.513671875,
"logps/rejected": -189.9994354248047,
"loss": 0.6933,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0020346306264400482,
"rewards/margins": 0.0011342220241203904,
"rewards/rejected": 0.0009004086023196578,
"step": 180
},
{
"epoch": 0.03,
"learning_rate": 9.97984886649874e-08,
"logits/chosen": -2.730062484741211,
"logits/rejected": -2.8065617084503174,
"logps/chosen": -278.373046875,
"logps/rejected": -261.8786315917969,
"loss": 0.6933,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": -0.0013691270723938942,
"rewards/margins": -0.0007420595502480865,
"rewards/rejected": -0.0006270675803534687,
"step": 190
},
{
"epoch": 0.04,
"learning_rate": 9.974811083123425e-08,
"logits/chosen": -2.773843765258789,
"logits/rejected": -2.774496555328369,
"logps/chosen": -243.3163604736328,
"logps/rejected": -234.8438720703125,
"loss": 0.6931,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0005632409593090415,
"rewards/margins": -4.069525675731711e-05,
"rewards/rejected": 0.0006039362633600831,
"step": 200
},
{
"epoch": 0.04,
"learning_rate": 9.96977329974811e-08,
"logits/chosen": -2.797464370727539,
"logits/rejected": -2.779179811477661,
"logps/chosen": -213.2550506591797,
"logps/rejected": -183.4717254638672,
"loss": 0.6929,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.001099438639357686,
"rewards/margins": -0.0010665215086191893,
"rewards/rejected": 0.0021659601479768753,
"step": 210
},
{
"epoch": 0.04,
"learning_rate": 9.964735516372796e-08,
"logits/chosen": -2.672825336456299,
"logits/rejected": -2.753871440887451,
"logps/chosen": -187.55667114257812,
"logps/rejected": -199.6050262451172,
"loss": 0.6932,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": -0.00040147211984731257,
"rewards/margins": -0.0006626142421737313,
"rewards/rejected": 0.0002611424424685538,
"step": 220
},
{
"epoch": 0.04,
"learning_rate": 9.959697732997481e-08,
"logits/chosen": -2.73313570022583,
"logits/rejected": -2.7167673110961914,
"logps/chosen": -207.70272827148438,
"logps/rejected": -201.5740203857422,
"loss": 0.6933,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": -0.001323978416621685,
"rewards/margins": -0.0013272857759147882,
"rewards/rejected": 3.307475708425045e-06,
"step": 230
},
{
"epoch": 0.04,
"learning_rate": 9.954659949622166e-08,
"logits/chosen": -2.7659072875976562,
"logits/rejected": -2.854525566101074,
"logps/chosen": -247.24267578125,
"logps/rejected": -216.25,
"loss": 0.6931,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": -0.0007479648338630795,
"rewards/margins": 0.00017742058844305575,
"rewards/rejected": -0.0009253855096176267,
"step": 240
},
{
"epoch": 0.04,
"learning_rate": 9.94962216624685e-08,
"logits/chosen": -2.681570053100586,
"logits/rejected": -2.746302843093872,
"logps/chosen": -305.2917785644531,
"logps/rejected": -295.3072509765625,
"loss": 0.693,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0004612560442183167,
"rewards/margins": 0.0005774974706582725,
"rewards/rejected": -0.0001162414118880406,
"step": 250
},
{
"epoch": 0.05,
"learning_rate": 9.944584382871536e-08,
"logits/chosen": -2.7773802280426025,
"logits/rejected": -2.7356131076812744,
"logps/chosen": -260.58135986328125,
"logps/rejected": -247.7050323486328,
"loss": 0.6932,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0014422254171222448,
"rewards/margins": 0.0032965210266411304,
"rewards/rejected": -0.0018542958423495293,
"step": 260
},
{
"epoch": 0.05,
"learning_rate": 9.939546599496221e-08,
"logits/chosen": -2.6985695362091064,
"logits/rejected": -2.768378257751465,
"logps/chosen": -209.56796264648438,
"logps/rejected": -199.95033264160156,
"loss": 0.6935,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": -0.000545819231774658,
"rewards/margins": 0.0005106240278109908,
"rewards/rejected": -0.0010564432013779879,
"step": 270
},
{
"epoch": 0.05,
"learning_rate": 9.934508816120907e-08,
"logits/chosen": -2.7142832279205322,
"logits/rejected": -2.727756977081299,
"logps/chosen": -311.3549499511719,
"logps/rejected": -293.3232727050781,
"loss": 0.693,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.001072610029950738,
"rewards/margins": 0.0006248473073355854,
"rewards/rejected": 0.0004477625770960003,
"step": 280
},
{
"epoch": 0.05,
"learning_rate": 9.929471032745591e-08,
"logits/chosen": -2.6512770652770996,
"logits/rejected": -2.677826404571533,
"logps/chosen": -217.1204833984375,
"logps/rejected": -199.79481506347656,
"loss": 0.6928,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 5.9052497817901894e-05,
"rewards/margins": 0.00203351816162467,
"rewards/rejected": -0.0019744650926440954,
"step": 290
},
{
"epoch": 0.05,
"learning_rate": 9.924433249370276e-08,
"logits/chosen": -2.6881537437438965,
"logits/rejected": -2.7492778301239014,
"logps/chosen": -277.6586608886719,
"logps/rejected": -240.2971954345703,
"loss": 0.6931,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0018934666877612472,
"rewards/margins": 0.001739538973197341,
"rewards/rejected": 0.00015392780187539756,
"step": 300
},
{
"epoch": 0.05,
"learning_rate": 9.919395465994961e-08,
"logits/chosen": -2.7815330028533936,
"logits/rejected": -2.7532501220703125,
"logps/chosen": -257.75836181640625,
"logps/rejected": -200.2654571533203,
"loss": 0.6934,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.0008091029012575746,
"rewards/margins": -0.001112941768951714,
"rewards/rejected": 0.00030383875127881765,
"step": 310
},
{
"epoch": 0.06,
"learning_rate": 9.914357682619647e-08,
"logits/chosen": -2.826770782470703,
"logits/rejected": -2.845146417617798,
"logps/chosen": -250.01553344726562,
"logps/rejected": -218.0773162841797,
"loss": 0.6933,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.00093313108664006,
"rewards/margins": 0.0006354941288009286,
"rewards/rejected": 0.00029763689963147044,
"step": 320
},
{
"epoch": 0.06,
"learning_rate": 9.909319899244332e-08,
"logits/chosen": -2.6958234310150146,
"logits/rejected": -2.7005648612976074,
"logps/chosen": -236.06967163085938,
"logps/rejected": -190.2051239013672,
"loss": 0.6931,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.0011252507101744413,
"rewards/margins": -0.00028516483143903315,
"rewards/rejected": 0.0014104156289249659,
"step": 330
},
{
"epoch": 0.06,
"learning_rate": 9.904282115869017e-08,
"logits/chosen": -2.7159180641174316,
"logits/rejected": -2.755709648132324,
"logps/chosen": -232.99978637695312,
"logps/rejected": -195.90316772460938,
"loss": 0.6931,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0008891105535440147,
"rewards/margins": 0.0006613129517063498,
"rewards/rejected": 0.00022779754363000393,
"step": 340
},
{
"epoch": 0.06,
"learning_rate": 9.899244332493703e-08,
"logits/chosen": -2.8205747604370117,
"logits/rejected": -2.790215253829956,
"logps/chosen": -235.89877319335938,
"logps/rejected": -194.9135284423828,
"loss": 0.6931,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": -0.0006920454325154424,
"rewards/margins": -0.0019427335355430841,
"rewards/rejected": 0.001250688568688929,
"step": 350
},
{
"epoch": 0.06,
"learning_rate": 9.894206549118388e-08,
"logits/chosen": -2.706644058227539,
"logits/rejected": -2.7300548553466797,
"logps/chosen": -224.51806640625,
"logps/rejected": -253.60177612304688,
"loss": 0.6932,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": -0.0006736659561283886,
"rewards/margins": -0.002054039854556322,
"rewards/rejected": 0.0013803739566355944,
"step": 360
},
{
"epoch": 0.06,
"learning_rate": 9.889168765743072e-08,
"logits/chosen": -2.7433345317840576,
"logits/rejected": -2.810014247894287,
"logps/chosen": -223.27615356445312,
"logps/rejected": -212.83901977539062,
"loss": 0.693,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": -0.00019951626018155366,
"rewards/margins": -0.000935495481826365,
"rewards/rejected": 0.0007359791197814047,
"step": 370
},
{
"epoch": 0.07,
"learning_rate": 9.884130982367758e-08,
"logits/chosen": -2.8322505950927734,
"logits/rejected": -2.8160457611083984,
"logps/chosen": -257.120361328125,
"logps/rejected": -204.89254760742188,
"loss": 0.693,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.001022899174131453,
"rewards/margins": 0.000910973350983113,
"rewards/rejected": 0.0001119256266974844,
"step": 380
},
{
"epoch": 0.07,
"learning_rate": 9.879093198992443e-08,
"logits/chosen": -2.675583839416504,
"logits/rejected": -2.6759538650512695,
"logps/chosen": -195.3834686279297,
"logps/rejected": -161.30630493164062,
"loss": 0.6931,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0015894779935479164,
"rewards/margins": 0.0003656911721918732,
"rewards/rejected": 0.0012237867340445518,
"step": 390
},
{
"epoch": 0.07,
"learning_rate": 9.874055415617128e-08,
"logits/chosen": -2.775231122970581,
"logits/rejected": -2.8162126541137695,
"logps/chosen": -293.67376708984375,
"logps/rejected": -233.018798828125,
"loss": 0.693,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.0006875410908833146,
"rewards/margins": -0.0008610993390902877,
"rewards/rejected": 0.00017355827731080353,
"step": 400
},
{
"epoch": 0.07,
"learning_rate": 9.869017632241812e-08,
"logits/chosen": -2.7781994342803955,
"logits/rejected": -2.8431591987609863,
"logps/chosen": -244.99267578125,
"logps/rejected": -192.35743713378906,
"loss": 0.6932,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.00142839050386101,
"rewards/margins": -0.0006640168721787632,
"rewards/rejected": 0.0020924073178321123,
"step": 410
},
{
"epoch": 0.07,
"learning_rate": 9.863979848866498e-08,
"logits/chosen": -2.7019505500793457,
"logits/rejected": -2.7378628253936768,
"logps/chosen": -237.5064697265625,
"logps/rejected": -203.72897338867188,
"loss": 0.6937,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0007829790702089667,
"rewards/margins": -0.0010059999767690897,
"rewards/rejected": 0.0017889788141474128,
"step": 420
},
{
"epoch": 0.08,
"learning_rate": 9.858942065491183e-08,
"logits/chosen": -2.741657257080078,
"logits/rejected": -2.771892547607422,
"logps/chosen": -246.7175750732422,
"logps/rejected": -202.51193237304688,
"loss": 0.693,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.00037730118492618203,
"rewards/margins": 0.00044115298078395426,
"rewards/rejected": -6.385180313372985e-05,
"step": 430
},
{
"epoch": 0.08,
"learning_rate": 9.853904282115868e-08,
"logits/chosen": -2.741157054901123,
"logits/rejected": -2.7170910835266113,
"logps/chosen": -230.9762725830078,
"logps/rejected": -197.1507110595703,
"loss": 0.6933,
"rewards/accuracies": 0.375,
"rewards/chosen": -5.774973033112474e-05,
"rewards/margins": -0.0021546499338001013,
"rewards/rejected": 0.002096900250762701,
"step": 440
},
{
"epoch": 0.08,
"learning_rate": 9.848866498740554e-08,
"logits/chosen": -2.797440767288208,
"logits/rejected": -2.752779245376587,
"logps/chosen": -245.9729766845703,
"logps/rejected": -222.7683868408203,
"loss": 0.6933,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": 0.0005045041325502098,
"rewards/margins": -0.0016038778703659773,
"rewards/rejected": 0.0021083818282932043,
"step": 450
},
{
"epoch": 0.08,
"learning_rate": 9.843828715365239e-08,
"logits/chosen": -2.728309154510498,
"logits/rejected": -2.7414863109588623,
"logps/chosen": -225.4750518798828,
"logps/rejected": -217.5722198486328,
"loss": 0.6929,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0019893483258783817,
"rewards/margins": 0.0019943092484027147,
"rewards/rejected": -4.960992555425037e-06,
"step": 460
},
{
"epoch": 0.08,
"learning_rate": 9.838790931989925e-08,
"logits/chosen": -2.6399004459381104,
"logits/rejected": -2.6418204307556152,
"logps/chosen": -259.00262451171875,
"logps/rejected": -232.1974639892578,
"loss": 0.693,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": -0.00039179419400170445,
"rewards/margins": -0.001004178891889751,
"rewards/rejected": 0.0006123848725110292,
"step": 470
},
{
"epoch": 0.08,
"learning_rate": 9.833753148614609e-08,
"logits/chosen": -2.7012977600097656,
"logits/rejected": -2.734711170196533,
"logps/chosen": -259.11505126953125,
"logps/rejected": -212.99191284179688,
"loss": 0.693,
"rewards/accuracies": 0.5,
"rewards/chosen": 3.07522714138031e-05,
"rewards/margins": -0.0009926442289724946,
"rewards/rejected": 0.0010233965003862977,
"step": 480
},
{
"epoch": 0.09,
"learning_rate": 9.828715365239294e-08,
"logits/chosen": -2.779294967651367,
"logits/rejected": -2.742389678955078,
"logps/chosen": -219.0150909423828,
"logps/rejected": -213.0858612060547,
"loss": 0.6936,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0007726555922999978,
"rewards/margins": -0.0002816848282236606,
"rewards/rejected": 0.0010543405078351498,
"step": 490
},
{
"epoch": 0.09,
"learning_rate": 9.823677581863979e-08,
"logits/chosen": -2.7667160034179688,
"logits/rejected": -2.746671199798584,
"logps/chosen": -241.52261352539062,
"logps/rejected": -244.81637573242188,
"loss": 0.6932,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0008761234348639846,
"rewards/margins": 0.000312745978590101,
"rewards/rejected": 0.0005633773980662227,
"step": 500
},
{
"epoch": 0.09,
"learning_rate": 9.818639798488665e-08,
"logits/chosen": -2.773653507232666,
"logits/rejected": -2.7031195163726807,
"logps/chosen": -188.9192352294922,
"logps/rejected": -198.82492065429688,
"loss": 0.6927,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0020457953214645386,
"rewards/margins": 0.0025221453979611397,
"rewards/rejected": -0.0004763497563544661,
"step": 510
},
{
"epoch": 0.09,
"learning_rate": 9.813602015113349e-08,
"logits/chosen": -2.767975330352783,
"logits/rejected": -2.745241641998291,
"logps/chosen": -255.3336639404297,
"logps/rejected": -210.2073516845703,
"loss": 0.6932,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0016272428911179304,
"rewards/margins": -3.840450517600402e-05,
"rewards/rejected": 0.0016656474908813834,
"step": 520
},
{
"epoch": 0.09,
"learning_rate": 9.808564231738034e-08,
"logits/chosen": -2.701375961303711,
"logits/rejected": -2.740355968475342,
"logps/chosen": -194.14346313476562,
"logps/rejected": -195.3939971923828,
"loss": 0.6931,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.001990049611777067,
"rewards/margins": -0.0021429904736578465,
"rewards/rejected": 0.004133040551096201,
"step": 530
},
{
"epoch": 0.09,
"learning_rate": 9.80352644836272e-08,
"logits/chosen": -2.7491579055786133,
"logits/rejected": -2.8547916412353516,
"logps/chosen": -257.10809326171875,
"logps/rejected": -218.61026000976562,
"loss": 0.6932,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0014056519139558077,
"rewards/margins": -7.3385540417802986e-06,
"rewards/rejected": 0.001412990503013134,
"step": 540
},
{
"epoch": 0.1,
"learning_rate": 9.798488664987405e-08,
"logits/chosen": -2.762587308883667,
"logits/rejected": -2.7138381004333496,
"logps/chosen": -250.11111450195312,
"logps/rejected": -210.0104217529297,
"loss": 0.6931,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0026454334147274494,
"rewards/margins": 0.0003759107203222811,
"rewards/rejected": 0.0022695225197821856,
"step": 550
},
{
"epoch": 0.1,
"learning_rate": 9.79345088161209e-08,
"logits/chosen": -2.7964959144592285,
"logits/rejected": -2.812797784805298,
"logps/chosen": -262.03253173828125,
"logps/rejected": -205.50057983398438,
"loss": 0.6931,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0009436160326004028,
"rewards/margins": 0.0005760550848208368,
"rewards/rejected": 0.00036756088957190514,
"step": 560
},
{
"epoch": 0.1,
"learning_rate": 9.788413098236776e-08,
"logits/chosen": -2.8215677738189697,
"logits/rejected": -2.803280830383301,
"logps/chosen": -243.072998046875,
"logps/rejected": -198.3536376953125,
"loss": 0.6928,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0028980812057852745,
"rewards/margins": 0.002744231838732958,
"rewards/rejected": 0.00015384898870252073,
"step": 570
},
{
"epoch": 0.1,
"learning_rate": 9.783375314861461e-08,
"logits/chosen": -2.8663644790649414,
"logits/rejected": -2.8302829265594482,
"logps/chosen": -231.59359741210938,
"logps/rejected": -258.3666076660156,
"loss": 0.6932,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.0001844273356255144,
"rewards/margins": -0.002044522203505039,
"rewards/rejected": 0.0022289494518190622,
"step": 580
},
{
"epoch": 0.1,
"learning_rate": 9.778337531486146e-08,
"logits/chosen": -2.7864925861358643,
"logits/rejected": -2.7147817611694336,
"logps/chosen": -229.01431274414062,
"logps/rejected": -186.32522583007812,
"loss": 0.6928,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 2.3794593744241865e-06,
"rewards/margins": 0.0006320485845208168,
"rewards/rejected": -0.000629669229965657,
"step": 590
},
{
"epoch": 0.11,
"learning_rate": 9.77329974811083e-08,
"logits/chosen": -2.754164218902588,
"logits/rejected": -2.7349648475646973,
"logps/chosen": -216.50918579101562,
"logps/rejected": -186.99282836914062,
"loss": 0.6928,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0005909929750487208,
"rewards/margins": 5.385982876759954e-05,
"rewards/rejected": 0.0005371329025365412,
"step": 600
},
{
"epoch": 0.11,
"learning_rate": 9.768261964735516e-08,
"logits/chosen": -2.754659652709961,
"logits/rejected": -2.727217197418213,
"logps/chosen": -236.4612274169922,
"logps/rejected": -213.8798828125,
"loss": 0.693,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0012212401488795877,
"rewards/margins": 0.00041647389298304915,
"rewards/rejected": 0.0008047660812735558,
"step": 610
},
{
"epoch": 0.11,
"learning_rate": 9.763224181360201e-08,
"logits/chosen": -2.767381191253662,
"logits/rejected": -2.773684501647949,
"logps/chosen": -276.1978759765625,
"logps/rejected": -241.90969848632812,
"loss": 0.6926,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.0022741584107279778,
"rewards/margins": 0.0036654185969382524,
"rewards/rejected": -0.0013912600697949529,
"step": 620
},
{
"epoch": 0.11,
"learning_rate": 9.758186397984886e-08,
"logits/chosen": -2.7231290340423584,
"logits/rejected": -2.799967050552368,
"logps/chosen": -288.275634765625,
"logps/rejected": -215.36392211914062,
"loss": 0.6932,
"rewards/accuracies": 0.3499999940395355,
"rewards/chosen": -8.152765076374635e-05,
"rewards/margins": -0.003193531883880496,
"rewards/rejected": 0.0031120043713599443,
"step": 630
},
{
"epoch": 0.11,
"learning_rate": 9.75314861460957e-08,
"logits/chosen": -2.8058621883392334,
"logits/rejected": -2.811411142349243,
"logps/chosen": -263.43182373046875,
"logps/rejected": -255.8742218017578,
"loss": 0.6928,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.0022689211182296276,
"rewards/margins": 0.0014448559377342463,
"rewards/rejected": 0.0008240645984187722,
"step": 640
},
{
"epoch": 0.11,
"learning_rate": 9.748110831234256e-08,
"logits/chosen": -2.8055179119110107,
"logits/rejected": -2.751683235168457,
"logps/chosen": -190.2101287841797,
"logps/rejected": -180.5990447998047,
"loss": 0.6926,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.00034066467196680605,
"rewards/margins": 0.001460460713133216,
"rewards/rejected": -0.0011197957210242748,
"step": 650
},
{
"epoch": 0.12,
"learning_rate": 9.743073047858941e-08,
"logits/chosen": -2.6653835773468018,
"logits/rejected": -2.6121246814727783,
"logps/chosen": -209.80648803710938,
"logps/rejected": -229.5626983642578,
"loss": 0.6933,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.0011562244035303593,
"rewards/margins": 0.00043965905206277966,
"rewards/rejected": 0.000716565118636936,
"step": 660
},
{
"epoch": 0.12,
"learning_rate": 9.738035264483628e-08,
"logits/chosen": -2.756425380706787,
"logits/rejected": -2.6906371116638184,
"logps/chosen": -208.0061798095703,
"logps/rejected": -227.17526245117188,
"loss": 0.6929,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.003370731370523572,
"rewards/margins": 0.0021752621978521347,
"rewards/rejected": 0.0011954689398407936,
"step": 670
},
{
"epoch": 0.12,
"learning_rate": 9.732997481108312e-08,
"logits/chosen": -2.748220920562744,
"logits/rejected": -2.739067554473877,
"logps/chosen": -204.1517791748047,
"logps/rejected": -174.79559326171875,
"loss": 0.6928,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0015211543068289757,
"rewards/margins": 0.001060990383848548,
"rewards/rejected": 0.0004601640102919191,
"step": 680
},
{
"epoch": 0.12,
"learning_rate": 9.727959697732997e-08,
"logits/chosen": -2.7568039894104004,
"logits/rejected": -2.7389419078826904,
"logps/chosen": -223.5104522705078,
"logps/rejected": -172.09033203125,
"loss": 0.6937,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": -4.150771928834729e-05,
"rewards/margins": -0.0012603879440575838,
"rewards/rejected": 0.001218880177475512,
"step": 690
},
{
"epoch": 0.12,
"learning_rate": 9.722921914357683e-08,
"logits/chosen": -2.762721300125122,
"logits/rejected": -2.750661611557007,
"logps/chosen": -230.8249969482422,
"logps/rejected": -231.24960327148438,
"loss": 0.6929,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0016020803013816476,
"rewards/margins": 0.0007085275137796998,
"rewards/rejected": 0.0008935527876019478,
"step": 700
},
{
"epoch": 0.12,
"learning_rate": 9.717884130982368e-08,
"logits/chosen": -2.6903281211853027,
"logits/rejected": -2.668412685394287,
"logps/chosen": -173.5829315185547,
"logps/rejected": -174.61099243164062,
"loss": 0.6931,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": -0.0005260295001789927,
"rewards/margins": -0.0008247641962952912,
"rewards/rejected": 0.00029873469611629844,
"step": 710
},
{
"epoch": 0.13,
"learning_rate": 9.712846347607052e-08,
"logits/chosen": -2.7260491847991943,
"logits/rejected": -2.723248243331909,
"logps/chosen": -228.8632049560547,
"logps/rejected": -191.02725219726562,
"loss": 0.6935,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.002371068811044097,
"rewards/margins": -0.0012089888332411647,
"rewards/rejected": 0.00358005752786994,
"step": 720
},
{
"epoch": 0.13,
"learning_rate": 9.707808564231737e-08,
"logits/chosen": -2.7456154823303223,
"logits/rejected": -2.681551456451416,
"logps/chosen": -257.8016052246094,
"logps/rejected": -246.4755096435547,
"loss": 0.6933,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.000685253064148128,
"rewards/margins": -0.0014969928888604045,
"rewards/rejected": 0.002182246185839176,
"step": 730
},
{
"epoch": 0.13,
"learning_rate": 9.702770780856423e-08,
"logits/chosen": -2.7827036380767822,
"logits/rejected": -2.7841458320617676,
"logps/chosen": -221.7444610595703,
"logps/rejected": -198.41885375976562,
"loss": 0.6932,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.0009337845258414745,
"rewards/margins": 8.86632114998065e-05,
"rewards/rejected": 0.0008451213943772018,
"step": 740
},
{
"epoch": 0.13,
"learning_rate": 9.697732997481108e-08,
"logits/chosen": -2.763047456741333,
"logits/rejected": -2.8110077381134033,
"logps/chosen": -236.8753204345703,
"logps/rejected": -191.76792907714844,
"loss": 0.6931,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.003436017083004117,
"rewards/margins": 0.000934536918066442,
"rewards/rejected": 0.0025014798156917095,
"step": 750
},
{
"epoch": 0.13,
"learning_rate": 9.692695214105792e-08,
"logits/chosen": -2.726303815841675,
"logits/rejected": -2.7912750244140625,
"logps/chosen": -315.33441162109375,
"logps/rejected": -216.3941650390625,
"loss": 0.6924,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0015838576946407557,
"rewards/margins": 0.0014837884809821844,
"rewards/rejected": 0.0001000691408989951,
"step": 760
},
{
"epoch": 0.13,
"learning_rate": 9.687657430730478e-08,
"logits/chosen": -2.702937602996826,
"logits/rejected": -2.7665514945983887,
"logps/chosen": -221.53292846679688,
"logps/rejected": -171.7909393310547,
"loss": 0.6927,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.0022713050711899996,
"rewards/margins": -0.00044591521145775914,
"rewards/rejected": 0.0027172204572707415,
"step": 770
},
{
"epoch": 0.14,
"learning_rate": 9.682619647355164e-08,
"logits/chosen": -2.83231520652771,
"logits/rejected": -2.841844081878662,
"logps/chosen": -228.69546508789062,
"logps/rejected": -169.39346313476562,
"loss": 0.6928,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.001805447624064982,
"rewards/margins": -0.0005494118086062372,
"rewards/rejected": 0.002354859607294202,
"step": 780
},
{
"epoch": 0.14,
"learning_rate": 9.677581863979848e-08,
"logits/chosen": -2.7778494358062744,
"logits/rejected": -2.7811062335968018,
"logps/chosen": -215.41586303710938,
"logps/rejected": -208.3562469482422,
"loss": 0.6927,
"rewards/accuracies": 0.3499999940395355,
"rewards/chosen": 0.00014900062524247915,
"rewards/margins": -0.002759304828941822,
"rewards/rejected": 0.0029083057306706905,
"step": 790
},
{
"epoch": 0.14,
"learning_rate": 9.672544080604534e-08,
"logits/chosen": -2.706941604614258,
"logits/rejected": -2.7043490409851074,
"logps/chosen": -252.07980346679688,
"logps/rejected": -224.51388549804688,
"loss": 0.693,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.0011368256527930498,
"rewards/margins": 0.001408792450092733,
"rewards/rejected": -0.0002719667972996831,
"step": 800
},
{
"epoch": 0.14,
"learning_rate": 9.667506297229219e-08,
"logits/chosen": -2.7257018089294434,
"logits/rejected": -2.688807725906372,
"logps/chosen": -230.65444946289062,
"logps/rejected": -203.5872802734375,
"loss": 0.6928,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0041201431304216385,
"rewards/margins": 0.0013161466922610998,
"rewards/rejected": 0.0028039959724992514,
"step": 810
},
{
"epoch": 0.14,
"learning_rate": 9.662468513853904e-08,
"logits/chosen": -2.7131431102752686,
"logits/rejected": -2.7395095825195312,
"logps/chosen": -246.7789764404297,
"logps/rejected": -224.97299194335938,
"loss": 0.6929,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0022838334552943707,
"rewards/margins": 0.0005551796639338136,
"rewards/rejected": 0.0017286535585299134,
"step": 820
},
{
"epoch": 0.15,
"learning_rate": 9.657430730478588e-08,
"logits/chosen": -2.801877498626709,
"logits/rejected": -2.7862987518310547,
"logps/chosen": -242.6244659423828,
"logps/rejected": -223.6712646484375,
"loss": 0.693,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0037963681388646364,
"rewards/margins": 0.0008951274794526398,
"rewards/rejected": 0.0029012407176196575,
"step": 830
},
{
"epoch": 0.15,
"learning_rate": 9.652392947103274e-08,
"logits/chosen": -2.763369560241699,
"logits/rejected": -2.7350258827209473,
"logps/chosen": -231.41952514648438,
"logps/rejected": -207.5250244140625,
"loss": 0.6931,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0018902644515037537,
"rewards/margins": 0.000653119117487222,
"rewards/rejected": 0.0012371453922241926,
"step": 840
},
{
"epoch": 0.15,
"learning_rate": 9.647355163727959e-08,
"logits/chosen": -2.709563732147217,
"logits/rejected": -2.7220940589904785,
"logps/chosen": -229.4707489013672,
"logps/rejected": -200.20779418945312,
"loss": 0.6927,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0027879923582077026,
"rewards/margins": 0.0006196832982823253,
"rewards/rejected": 0.002168309409171343,
"step": 850
},
{
"epoch": 0.15,
"learning_rate": 9.642317380352644e-08,
"logits/chosen": -2.7222867012023926,
"logits/rejected": -2.686190128326416,
"logps/chosen": -250.36752319335938,
"logps/rejected": -195.4890899658203,
"loss": 0.6932,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0026868334971368313,
"rewards/margins": -0.00014689173258375376,
"rewards/rejected": 0.0028337249532341957,
"step": 860
},
{
"epoch": 0.15,
"learning_rate": 9.637279596977329e-08,
"logits/chosen": -2.6420130729675293,
"logits/rejected": -2.7638611793518066,
"logps/chosen": -272.90576171875,
"logps/rejected": -225.89804077148438,
"loss": 0.6931,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.003827697830274701,
"rewards/margins": 0.001123771769925952,
"rewards/rejected": 0.002703926060348749,
"step": 870
},
{
"epoch": 0.15,
"learning_rate": 9.632241813602014e-08,
"logits/chosen": -2.804816722869873,
"logits/rejected": -2.793016195297241,
"logps/chosen": -236.7283477783203,
"logps/rejected": -191.2239990234375,
"loss": 0.693,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0009727630531415343,
"rewards/margins": -0.0009720485541038215,
"rewards/rejected": 0.0019448116654530168,
"step": 880
},
{
"epoch": 0.16,
"learning_rate": 9.6272040302267e-08,
"logits/chosen": -2.7938032150268555,
"logits/rejected": -2.7507739067077637,
"logps/chosen": -206.41567993164062,
"logps/rejected": -178.12667846679688,
"loss": 0.693,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.0008494978537783027,
"rewards/margins": -0.0007513789460062981,
"rewards/rejected": 0.0016008767997846007,
"step": 890
},
{
"epoch": 0.16,
"learning_rate": 9.622166246851386e-08,
"logits/chosen": -2.7419960498809814,
"logits/rejected": -2.8216521739959717,
"logps/chosen": -292.3438720703125,
"logps/rejected": -209.7271270751953,
"loss": 0.6927,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.00268277944996953,
"rewards/margins": -0.00072367989923805,
"rewards/rejected": 0.0034064589999616146,
"step": 900
},
{
"epoch": 0.16,
"learning_rate": 9.61712846347607e-08,
"logits/chosen": -2.716244697570801,
"logits/rejected": -2.7290053367614746,
"logps/chosen": -218.2609100341797,
"logps/rejected": -196.04891967773438,
"loss": 0.6932,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.0014504556311294436,
"rewards/margins": -0.0006075268611311913,
"rewards/rejected": 0.0020579826086759567,
"step": 910
},
{
"epoch": 0.16,
"learning_rate": 9.612090680100755e-08,
"logits/chosen": -2.7427549362182617,
"logits/rejected": -2.7771146297454834,
"logps/chosen": -205.1763916015625,
"logps/rejected": -197.89157104492188,
"loss": 0.6931,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.001757201156578958,
"rewards/margins": 0.0007729234057478607,
"rewards/rejected": 0.0009842776926234365,
"step": 920
},
{
"epoch": 0.16,
"learning_rate": 9.607052896725441e-08,
"logits/chosen": -2.810089349746704,
"logits/rejected": -2.7477164268493652,
"logps/chosen": -234.19094848632812,
"logps/rejected": -238.1735076904297,
"loss": 0.6928,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.0020914555061608553,
"rewards/margins": -0.0015822440618649125,
"rewards/rejected": 0.003673699451610446,
"step": 930
},
{
"epoch": 0.16,
"learning_rate": 9.602015113350126e-08,
"logits/chosen": -2.7463126182556152,
"logits/rejected": -2.7717044353485107,
"logps/chosen": -318.3886413574219,
"logps/rejected": -217.30325317382812,
"loss": 0.6932,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.0019021205371245742,
"rewards/margins": -0.0013187190052121878,
"rewards/rejected": 0.003220838960260153,
"step": 940
},
{
"epoch": 0.17,
"learning_rate": 9.59697732997481e-08,
"logits/chosen": -2.7562918663024902,
"logits/rejected": -2.737678050994873,
"logps/chosen": -212.1610870361328,
"logps/rejected": -169.73379516601562,
"loss": 0.6928,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.003521175589412451,
"rewards/margins": 0.00361448572948575,
"rewards/rejected": -9.331032924819738e-05,
"step": 950
},
{
"epoch": 0.17,
"learning_rate": 9.591939546599495e-08,
"logits/chosen": -2.785679340362549,
"logits/rejected": -2.775289535522461,
"logps/chosen": -266.58660888671875,
"logps/rejected": -248.35580444335938,
"loss": 0.6934,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.002367380540817976,
"rewards/margins": -0.001244062907062471,
"rewards/rejected": 0.0036114430986344814,
"step": 960
},
{
"epoch": 0.17,
"learning_rate": 9.586901763224181e-08,
"logits/chosen": -2.775019645690918,
"logits/rejected": -2.751147747039795,
"logps/chosen": -272.42840576171875,
"logps/rejected": -262.1443176269531,
"loss": 0.6928,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0036885985173285007,
"rewards/margins": 0.002885077614337206,
"rewards/rejected": 0.0008035210776142776,
"step": 970
},
{
"epoch": 0.17,
"learning_rate": 9.581863979848866e-08,
"logits/chosen": -2.726874351501465,
"logits/rejected": -2.768751621246338,
"logps/chosen": -236.5287322998047,
"logps/rejected": -211.50131225585938,
"loss": 0.6928,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.0035156819503754377,
"rewards/margins": -0.0017192515078932047,
"rewards/rejected": 0.005234933458268642,
"step": 980
},
{
"epoch": 0.17,
"learning_rate": 9.57682619647355e-08,
"logits/chosen": -2.7328333854675293,
"logits/rejected": -2.7810556888580322,
"logps/chosen": -253.5846405029297,
"logps/rejected": -208.56729125976562,
"loss": 0.693,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.004323097877204418,
"rewards/margins": 0.001049490412697196,
"rewards/rejected": 0.003273607464507222,
"step": 990
},
{
"epoch": 0.18,
"learning_rate": 9.571788413098237e-08,
"logits/chosen": -2.775546073913574,
"logits/rejected": -2.7548234462738037,
"logps/chosen": -274.9341735839844,
"logps/rejected": -214.09378051757812,
"loss": 0.693,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.004553532227873802,
"rewards/margins": 0.0013717750553041697,
"rewards/rejected": 0.003181757405400276,
"step": 1000
},
{
"epoch": 0.18,
"learning_rate": 9.566750629722922e-08,
"logits/chosen": -2.7104849815368652,
"logits/rejected": -2.698439121246338,
"logps/chosen": -255.5958251953125,
"logps/rejected": -174.08676147460938,
"loss": 0.6928,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.003329707309603691,
"rewards/margins": 0.0009661338990554214,
"rewards/rejected": 0.002363573294132948,
"step": 1010
},
{
"epoch": 0.18,
"learning_rate": 9.561712846347608e-08,
"logits/chosen": -2.667184591293335,
"logits/rejected": -2.633574962615967,
"logps/chosen": -197.6795196533203,
"logps/rejected": -169.07440185546875,
"loss": 0.6929,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.000696418690495193,
"rewards/margins": 0.0006790427723899484,
"rewards/rejected": 1.7376034520566463e-05,
"step": 1020
},
{
"epoch": 0.18,
"learning_rate": 9.556675062972292e-08,
"logits/chosen": -2.7279274463653564,
"logits/rejected": -2.725475311279297,
"logps/chosen": -224.8273468017578,
"logps/rejected": -199.46923828125,
"loss": 0.693,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0031109179835766554,
"rewards/margins": -3.088197991019115e-05,
"rewards/rejected": 0.0031417999416589737,
"step": 1030
},
{
"epoch": 0.18,
"learning_rate": 9.551637279596977e-08,
"logits/chosen": -2.7452080249786377,
"logits/rejected": -2.748317003250122,
"logps/chosen": -251.00180053710938,
"logps/rejected": -221.8520050048828,
"loss": 0.6929,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.002598334103822708,
"rewards/margins": -0.00022798255668021739,
"rewards/rejected": 0.002826316747814417,
"step": 1040
},
{
"epoch": 0.18,
"learning_rate": 9.546599496221662e-08,
"logits/chosen": -2.7736282348632812,
"logits/rejected": -2.7318246364593506,
"logps/chosen": -261.21356201171875,
"logps/rejected": -215.4080352783203,
"loss": 0.6927,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0046277581714093685,
"rewards/margins": 0.0004109583387617022,
"rewards/rejected": 0.004216799978166819,
"step": 1050
},
{
"epoch": 0.19,
"learning_rate": 9.541561712846348e-08,
"logits/chosen": -2.831284999847412,
"logits/rejected": -2.7485132217407227,
"logps/chosen": -263.9079284667969,
"logps/rejected": -222.78909301757812,
"loss": 0.6932,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.004149717278778553,
"rewards/margins": -0.0001199671532958746,
"rewards/rejected": 0.004269684199243784,
"step": 1060
},
{
"epoch": 0.19,
"learning_rate": 9.536523929471032e-08,
"logits/chosen": -2.7859325408935547,
"logits/rejected": -2.7743453979492188,
"logps/chosen": -205.18862915039062,
"logps/rejected": -163.95297241210938,
"loss": 0.6926,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.001009289757348597,
"rewards/margins": -0.0014739797916263342,
"rewards/rejected": 0.002483269665390253,
"step": 1070
},
{
"epoch": 0.19,
"learning_rate": 9.531486146095717e-08,
"logits/chosen": -2.7141454219818115,
"logits/rejected": -2.742264747619629,
"logps/chosen": -212.10800170898438,
"logps/rejected": -211.097900390625,
"loss": 0.6927,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.002731418702751398,
"rewards/margins": -0.0012434081872925162,
"rewards/rejected": 0.003974826540797949,
"step": 1080
},
{
"epoch": 0.19,
"learning_rate": 9.526448362720403e-08,
"logits/chosen": -2.646359920501709,
"logits/rejected": -2.671069622039795,
"logps/chosen": -197.65640258789062,
"logps/rejected": -180.06640625,
"loss": 0.6929,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0025646693538874388,
"rewards/margins": 0.0011420946102589369,
"rewards/rejected": 0.0014225749764591455,
"step": 1090
},
{
"epoch": 0.19,
"learning_rate": 9.521410579345087e-08,
"logits/chosen": -2.7953693866729736,
"logits/rejected": -2.7932047843933105,
"logps/chosen": -197.06411743164062,
"logps/rejected": -199.5815887451172,
"loss": 0.6929,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.004566690884530544,
"rewards/margins": 4.555946361506358e-05,
"rewards/rejected": 0.00452113151550293,
"step": 1100
},
{
"epoch": 0.19,
"learning_rate": 9.516372795969773e-08,
"logits/chosen": -2.75532865524292,
"logits/rejected": -2.768794536590576,
"logps/chosen": -247.06533813476562,
"logps/rejected": -203.4183807373047,
"loss": 0.6934,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.0037621301598846912,
"rewards/margins": -0.00023272607359103858,
"rewards/rejected": 0.003994855564087629,
"step": 1110
},
{
"epoch": 0.2,
"learning_rate": 9.511335012594459e-08,
"logits/chosen": -2.7900328636169434,
"logits/rejected": -2.747842311859131,
"logps/chosen": -233.60934448242188,
"logps/rejected": -209.6956329345703,
"loss": 0.6927,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.002573530189692974,
"rewards/margins": -0.0018167212838307023,
"rewards/rejected": 0.004390250891447067,
"step": 1120
},
{
"epoch": 0.2,
"learning_rate": 9.506297229219144e-08,
"logits/chosen": -2.8266825675964355,
"logits/rejected": -2.7168092727661133,
"logps/chosen": -266.6517028808594,
"logps/rejected": -240.08877563476562,
"loss": 0.6932,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.005716273095458746,
"rewards/margins": 0.0027064047753810883,
"rewards/rejected": 0.003009868785738945,
"step": 1130
},
{
"epoch": 0.2,
"learning_rate": 9.501259445843828e-08,
"logits/chosen": -2.7689754962921143,
"logits/rejected": -2.7763471603393555,
"logps/chosen": -289.73931884765625,
"logps/rejected": -222.8748016357422,
"loss": 0.693,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.0030738338828086853,
"rewards/margins": -0.001451755058951676,
"rewards/rejected": 0.004525588359683752,
"step": 1140
},
{
"epoch": 0.2,
"learning_rate": 9.496221662468513e-08,
"logits/chosen": -2.768038272857666,
"logits/rejected": -2.754030704498291,
"logps/chosen": -234.2838592529297,
"logps/rejected": -202.77279663085938,
"loss": 0.6925,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.004740605130791664,
"rewards/margins": 0.0016939297784119844,
"rewards/rejected": 0.0030466755852103233,
"step": 1150
},
{
"epoch": 0.2,
"learning_rate": 9.491183879093199e-08,
"logits/chosen": -2.8069653511047363,
"logits/rejected": -2.7526118755340576,
"logps/chosen": -209.11172485351562,
"logps/rejected": -200.98428344726562,
"loss": 0.6925,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.005559694021940231,
"rewards/margins": 0.002170537132769823,
"rewards/rejected": 0.0033891566563397646,
"step": 1160
},
{
"epoch": 0.2,
"learning_rate": 9.486146095717884e-08,
"logits/chosen": -2.7833895683288574,
"logits/rejected": -2.755847930908203,
"logps/chosen": -228.0541229248047,
"logps/rejected": -222.4268035888672,
"loss": 0.6926,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.00539207411929965,
"rewards/margins": 0.0042550102807581425,
"rewards/rejected": 0.001137065002694726,
"step": 1170
},
{
"epoch": 0.21,
"learning_rate": 9.481108312342568e-08,
"logits/chosen": -2.8028454780578613,
"logits/rejected": -2.798689365386963,
"logps/chosen": -251.14501953125,
"logps/rejected": -244.967041015625,
"loss": 0.6929,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.0028695925138890743,
"rewards/margins": 0.0012147616362199187,
"rewards/rejected": 0.0016548307612538338,
"step": 1180
},
{
"epoch": 0.21,
"learning_rate": 9.476070528967254e-08,
"logits/chosen": -2.7660348415374756,
"logits/rejected": -2.8378560543060303,
"logps/chosen": -250.03372192382812,
"logps/rejected": -201.1326446533203,
"loss": 0.6933,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.005208217538893223,
"rewards/margins": 0.0004181812109891325,
"rewards/rejected": 0.004790036473423243,
"step": 1190
},
{
"epoch": 0.21,
"learning_rate": 9.471032745591939e-08,
"logits/chosen": -2.738584280014038,
"logits/rejected": -2.799468517303467,
"logps/chosen": -294.7505187988281,
"logps/rejected": -218.1544647216797,
"loss": 0.6929,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.002887497888877988,
"rewards/margins": 0.0018897324334830046,
"rewards/rejected": 0.000997765688225627,
"step": 1200
},
{
"epoch": 0.21,
"learning_rate": 9.465994962216624e-08,
"logits/chosen": -2.744781970977783,
"logits/rejected": -2.764321804046631,
"logps/chosen": -203.63406372070312,
"logps/rejected": -165.10145568847656,
"loss": 0.6934,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0023968457244336605,
"rewards/margins": 0.00017872030730359256,
"rewards/rejected": 0.002218125155195594,
"step": 1210
},
{
"epoch": 0.21,
"learning_rate": 9.460957178841308e-08,
"logits/chosen": -2.7360353469848633,
"logits/rejected": -2.746555805206299,
"logps/chosen": -211.74185180664062,
"logps/rejected": -180.95497131347656,
"loss": 0.6921,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.004236987791955471,
"rewards/margins": 0.0014550769701600075,
"rewards/rejected": 0.002781911287456751,
"step": 1220
},
{
"epoch": 0.22,
"learning_rate": 9.455919395465995e-08,
"logits/chosen": -2.7374870777130127,
"logits/rejected": -2.7698867321014404,
"logps/chosen": -215.5163116455078,
"logps/rejected": -210.37368774414062,
"loss": 0.693,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.004980830010026693,
"rewards/margins": 0.0006271142628975213,
"rewards/rejected": 0.004353716038167477,
"step": 1230
},
{
"epoch": 0.22,
"learning_rate": 9.45088161209068e-08,
"logits/chosen": -2.807363271713257,
"logits/rejected": -2.7921762466430664,
"logps/chosen": -199.8319091796875,
"logps/rejected": -177.23934936523438,
"loss": 0.6926,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.004381081089377403,
"rewards/margins": 0.0005592384259216487,
"rewards/rejected": 0.00382184237241745,
"step": 1240
},
{
"epoch": 0.22,
"learning_rate": 9.445843828715366e-08,
"logits/chosen": -2.8015992641448975,
"logits/rejected": -2.7855136394500732,
"logps/chosen": -253.15487670898438,
"logps/rejected": -222.3345947265625,
"loss": 0.6928,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.004838630557060242,
"rewards/margins": -9.69449756667018e-05,
"rewards/rejected": 0.004935575183480978,
"step": 1250
},
{
"epoch": 0.22,
"learning_rate": 9.44080604534005e-08,
"logits/chosen": -2.6941018104553223,
"logits/rejected": -2.6818172931671143,
"logps/chosen": -231.94412231445312,
"logps/rejected": -228.63485717773438,
"loss": 0.6922,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.00432557100430131,
"rewards/margins": -0.0011508779134601355,
"rewards/rejected": 0.005476449616253376,
"step": 1260
},
{
"epoch": 0.22,
"learning_rate": 9.435768261964735e-08,
"logits/chosen": -2.788661479949951,
"logits/rejected": -2.713569402694702,
"logps/chosen": -228.61123657226562,
"logps/rejected": -230.6959686279297,
"loss": 0.6933,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.0030228032264858484,
"rewards/margins": -0.002682460006326437,
"rewards/rejected": 0.005705262999981642,
"step": 1270
},
{
"epoch": 0.22,
"learning_rate": 9.43073047858942e-08,
"logits/chosen": -2.7489657402038574,
"logits/rejected": -2.7751262187957764,
"logps/chosen": -260.9920349121094,
"logps/rejected": -214.2970733642578,
"loss": 0.6932,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": 0.00232306937687099,
"rewards/margins": -0.002894314704462886,
"rewards/rejected": 0.005217384081333876,
"step": 1280
},
{
"epoch": 0.23,
"learning_rate": 9.425692695214106e-08,
"logits/chosen": -2.7719390392303467,
"logits/rejected": -2.8384242057800293,
"logps/chosen": -253.56301879882812,
"logps/rejected": -174.05593872070312,
"loss": 0.6929,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.00489515345543623,
"rewards/margins": 0.0007793476688675582,
"rewards/rejected": 0.00411580502986908,
"step": 1290
},
{
"epoch": 0.23,
"learning_rate": 9.42065491183879e-08,
"logits/chosen": -2.787092447280884,
"logits/rejected": -2.73928165435791,
"logps/chosen": -230.39700317382812,
"logps/rejected": -205.6045684814453,
"loss": 0.693,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.004592005163431168,
"rewards/margins": 0.0004286689218133688,
"rewards/rejected": 0.004163335543125868,
"step": 1300
},
{
"epoch": 0.23,
"learning_rate": 9.415617128463475e-08,
"logits/chosen": -2.7811431884765625,
"logits/rejected": -2.778087615966797,
"logps/chosen": -242.17929077148438,
"logps/rejected": -206.31338500976562,
"loss": 0.6927,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0039786649867892265,
"rewards/margins": -0.0004098299832548946,
"rewards/rejected": 0.00438849488273263,
"step": 1310
},
{
"epoch": 0.23,
"learning_rate": 9.41057934508816e-08,
"logits/chosen": -2.6959187984466553,
"logits/rejected": -2.788710832595825,
"logps/chosen": -239.3393096923828,
"logps/rejected": -177.31842041015625,
"loss": 0.6925,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0030113484244793653,
"rewards/margins": 0.0008161927689798176,
"rewards/rejected": 0.0021951559465378523,
"step": 1320
},
{
"epoch": 0.23,
"learning_rate": 9.405541561712846e-08,
"logits/chosen": -2.8158926963806152,
"logits/rejected": -2.7934420108795166,
"logps/chosen": -246.5731964111328,
"logps/rejected": -215.53076171875,
"loss": 0.6925,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": 0.0015319122467190027,
"rewards/margins": -0.0007288408814929426,
"rewards/rejected": 0.0022607529535889626,
"step": 1330
},
{
"epoch": 0.23,
"learning_rate": 9.400503778337531e-08,
"logits/chosen": -2.648024320602417,
"logits/rejected": -2.6812193393707275,
"logps/chosen": -253.42678833007812,
"logps/rejected": -231.6710205078125,
"loss": 0.6928,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.006225033663213253,
"rewards/margins": 0.002081912010908127,
"rewards/rejected": 0.004143121186643839,
"step": 1340
},
{
"epoch": 0.24,
"learning_rate": 9.395465994962217e-08,
"logits/chosen": -2.7687926292419434,
"logits/rejected": -2.7247531414031982,
"logps/chosen": -198.0591278076172,
"logps/rejected": -180.5609893798828,
"loss": 0.6924,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.004522668197751045,
"rewards/margins": 0.0002378983626840636,
"rewards/rejected": 0.0042847697623074055,
"step": 1350
},
{
"epoch": 0.24,
"learning_rate": 9.390428211586902e-08,
"logits/chosen": -2.747763156890869,
"logits/rejected": -2.706991672515869,
"logps/chosen": -255.20736694335938,
"logps/rejected": -249.22946166992188,
"loss": 0.6927,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.003953252919018269,
"rewards/margins": -0.000359726749593392,
"rewards/rejected": 0.004312979988753796,
"step": 1360
},
{
"epoch": 0.24,
"learning_rate": 9.385390428211587e-08,
"logits/chosen": -2.7608680725097656,
"logits/rejected": -2.807486057281494,
"logps/chosen": -219.6439971923828,
"logps/rejected": -175.39483642578125,
"loss": 0.6927,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.002831274876371026,
"rewards/margins": 0.00012180556223029271,
"rewards/rejected": 0.0027094685938209295,
"step": 1370
},
{
"epoch": 0.24,
"learning_rate": 9.380352644836271e-08,
"logits/chosen": -2.713686466217041,
"logits/rejected": -2.7140908241271973,
"logps/chosen": -242.8909912109375,
"logps/rejected": -245.1560821533203,
"loss": 0.6929,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0032959680538624525,
"rewards/margins": -0.0015910521615296602,
"rewards/rejected": 0.004887019749730825,
"step": 1380
},
{
"epoch": 0.24,
"learning_rate": 9.375314861460957e-08,
"logits/chosen": -2.7107300758361816,
"logits/rejected": -2.703914165496826,
"logps/chosen": -230.3936767578125,
"logps/rejected": -253.17105102539062,
"loss": 0.6931,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.002635772805660963,
"rewards/margins": -0.0005686979275196791,
"rewards/rejected": 0.0032044709660112858,
"step": 1390
},
{
"epoch": 0.25,
"learning_rate": 9.370277078085642e-08,
"logits/chosen": -2.7594103813171387,
"logits/rejected": -2.766557455062866,
"logps/chosen": -224.17626953125,
"logps/rejected": -215.5638427734375,
"loss": 0.6927,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.005116119980812073,
"rewards/margins": 0.001255401293747127,
"rewards/rejected": 0.0038607188034802675,
"step": 1400
},
{
"epoch": 0.25,
"learning_rate": 9.365239294710328e-08,
"logits/chosen": -2.756953477859497,
"logits/rejected": -2.758610486984253,
"logps/chosen": -235.735107421875,
"logps/rejected": -188.66738891601562,
"loss": 0.6923,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.005391458515077829,
"rewards/margins": 0.0025972898583859205,
"rewards/rejected": 0.002794168423861265,
"step": 1410
},
{
"epoch": 0.25,
"learning_rate": 9.360201511335012e-08,
"logits/chosen": -2.655500888824463,
"logits/rejected": -2.6824567317962646,
"logps/chosen": -214.3753662109375,
"logps/rejected": -198.02159118652344,
"loss": 0.6925,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0019323080778121948,
"rewards/margins": 5.818065255880356e-05,
"rewards/rejected": 0.0018741274252533913,
"step": 1420
},
{
"epoch": 0.25,
"learning_rate": 9.355163727959697e-08,
"logits/chosen": -2.748979091644287,
"logits/rejected": -2.7408335208892822,
"logps/chosen": -218.5498046875,
"logps/rejected": -226.24478149414062,
"loss": 0.693,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.003222791478037834,
"rewards/margins": -0.0020806575194001198,
"rewards/rejected": 0.005303448997437954,
"step": 1430
},
{
"epoch": 0.25,
"learning_rate": 9.350125944584382e-08,
"logits/chosen": -2.83701229095459,
"logits/rejected": -2.812077283859253,
"logps/chosen": -219.4445343017578,
"logps/rejected": -199.6473846435547,
"loss": 0.6925,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.005975143052637577,
"rewards/margins": 0.0015650525456294417,
"rewards/rejected": 0.004410090856254101,
"step": 1440
},
{
"epoch": 0.25,
"learning_rate": 9.345088161209068e-08,
"logits/chosen": -2.7849693298339844,
"logits/rejected": -2.7290408611297607,
"logps/chosen": -208.5734405517578,
"logps/rejected": -195.73760986328125,
"loss": 0.6927,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.0017629098147153854,
"rewards/margins": -0.0009751931065693498,
"rewards/rejected": 0.0027381028048694134,
"step": 1450
},
{
"epoch": 0.26,
"learning_rate": 9.340050377833753e-08,
"logits/chosen": -2.7637295722961426,
"logits/rejected": -2.76435923576355,
"logps/chosen": -247.49789428710938,
"logps/rejected": -220.59597778320312,
"loss": 0.6925,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.007490481249988079,
"rewards/margins": 0.0033264905214309692,
"rewards/rejected": 0.00416399072855711,
"step": 1460
},
{
"epoch": 0.26,
"learning_rate": 9.335012594458438e-08,
"logits/chosen": -2.8603591918945312,
"logits/rejected": -2.8554975986480713,
"logps/chosen": -260.99822998046875,
"logps/rejected": -210.4870147705078,
"loss": 0.6927,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0044870320707559586,
"rewards/margins": 0.0010521438671275973,
"rewards/rejected": 0.003434887621551752,
"step": 1470
},
{
"epoch": 0.26,
"learning_rate": 9.329974811083124e-08,
"logits/chosen": -2.7806200981140137,
"logits/rejected": -2.780532121658325,
"logps/chosen": -220.0015106201172,
"logps/rejected": -210.1516571044922,
"loss": 0.6933,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.0038058434147387743,
"rewards/margins": -0.0014907947042956948,
"rewards/rejected": 0.005296637769788504,
"step": 1480
},
{
"epoch": 0.26,
"learning_rate": 9.324937027707808e-08,
"logits/chosen": -2.716339111328125,
"logits/rejected": -2.7717671394348145,
"logps/chosen": -222.77645874023438,
"logps/rejected": -188.9876708984375,
"loss": 0.6925,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.006295431405305862,
"rewards/margins": 0.001769342226907611,
"rewards/rejected": 0.004526089411228895,
"step": 1490
},
{
"epoch": 0.26,
"learning_rate": 9.319899244332493e-08,
"logits/chosen": -2.7848076820373535,
"logits/rejected": -2.763967990875244,
"logps/chosen": -258.8097839355469,
"logps/rejected": -231.8975372314453,
"loss": 0.6931,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.00430386234074831,
"rewards/margins": 0.000930764595977962,
"rewards/rejected": 0.0033730976283550262,
"step": 1500
},
{
"epoch": 0.26,
"learning_rate": 9.314861460957179e-08,
"logits/chosen": -2.7079567909240723,
"logits/rejected": -2.73983097076416,
"logps/chosen": -266.87939453125,
"logps/rejected": -215.9412078857422,
"loss": 0.6923,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.0085039883852005,
"rewards/margins": 0.0026515196077525616,
"rewards/rejected": 0.005852467846125364,
"step": 1510
},
{
"epoch": 0.27,
"learning_rate": 9.309823677581864e-08,
"logits/chosen": -2.796665668487549,
"logits/rejected": -2.7821192741394043,
"logps/chosen": -223.2317352294922,
"logps/rejected": -186.51785278320312,
"loss": 0.6927,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.00340632232837379,
"rewards/margins": 0.001166484085842967,
"rewards/rejected": 0.0022398384753614664,
"step": 1520
},
{
"epoch": 0.27,
"learning_rate": 9.304785894206548e-08,
"logits/chosen": -2.7554478645324707,
"logits/rejected": -2.720654010772705,
"logps/chosen": -242.2590789794922,
"logps/rejected": -228.3076171875,
"loss": 0.6928,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.006177330389618874,
"rewards/margins": 0.003083443734794855,
"rewards/rejected": 0.003093887586146593,
"step": 1530
},
{
"epoch": 0.27,
"learning_rate": 9.299748110831233e-08,
"logits/chosen": -2.735020875930786,
"logits/rejected": -2.69610595703125,
"logps/chosen": -235.02078247070312,
"logps/rejected": -209.3193817138672,
"loss": 0.6924,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": 0.003275824710726738,
"rewards/margins": -0.002175877569243312,
"rewards/rejected": 0.005451702047139406,
"step": 1540
},
{
"epoch": 0.27,
"learning_rate": 9.294710327455919e-08,
"logits/chosen": -2.7271084785461426,
"logits/rejected": -2.754586696624756,
"logps/chosen": -241.9888916015625,
"logps/rejected": -214.42196655273438,
"loss": 0.6921,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.006132029928267002,
"rewards/margins": 0.002107930602505803,
"rewards/rejected": 0.004024098627269268,
"step": 1550
},
{
"epoch": 0.27,
"learning_rate": 9.289672544080604e-08,
"logits/chosen": -2.7789578437805176,
"logits/rejected": -2.804396390914917,
"logps/chosen": -242.86337280273438,
"logps/rejected": -193.51954650878906,
"loss": 0.6928,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.005735357757657766,
"rewards/margins": 0.0003629502607509494,
"rewards/rejected": 0.0053724078461527824,
"step": 1560
},
{
"epoch": 0.28,
"learning_rate": 9.28463476070529e-08,
"logits/chosen": -2.7950856685638428,
"logits/rejected": -2.756988048553467,
"logps/chosen": -223.4980010986328,
"logps/rejected": -219.8987579345703,
"loss": 0.6921,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.004248038865625858,
"rewards/margins": 0.0013514070305973291,
"rewards/rejected": 0.002896632067859173,
"step": 1570
},
{
"epoch": 0.28,
"learning_rate": 9.279596977329975e-08,
"logits/chosen": -2.705752372741699,
"logits/rejected": -2.7348334789276123,
"logps/chosen": -230.68222045898438,
"logps/rejected": -227.8123321533203,
"loss": 0.6923,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.003918840549886227,
"rewards/margins": 0.0002412328467471525,
"rewards/rejected": 0.0036776072811335325,
"step": 1580
},
{
"epoch": 0.28,
"learning_rate": 9.27455919395466e-08,
"logits/chosen": -2.7165350914001465,
"logits/rejected": -2.7095649242401123,
"logps/chosen": -202.18948364257812,
"logps/rejected": -204.86062622070312,
"loss": 0.6927,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.0033042896538972855,
"rewards/margins": -0.0008645458146929741,
"rewards/rejected": 0.0041688354685902596,
"step": 1590
},
{
"epoch": 0.28,
"learning_rate": 9.269521410579345e-08,
"logits/chosen": -2.708650588989258,
"logits/rejected": -2.6804311275482178,
"logps/chosen": -204.07569885253906,
"logps/rejected": -151.32139587402344,
"loss": 0.6925,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.004048886708915234,
"rewards/margins": 0.0010695180390030146,
"rewards/rejected": 0.0029793691355735064,
"step": 1600
},
{
"epoch": 0.28,
"learning_rate": 9.26448362720403e-08,
"logits/chosen": -2.7520134449005127,
"logits/rejected": -2.7817509174346924,
"logps/chosen": -231.3147430419922,
"logps/rejected": -186.743896484375,
"loss": 0.6921,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.006745592691004276,
"rewards/margins": 0.0036534499377012253,
"rewards/rejected": 0.0030921432189643383,
"step": 1610
},
{
"epoch": 0.28,
"learning_rate": 9.259445843828715e-08,
"logits/chosen": -2.8089406490325928,
"logits/rejected": -2.804744243621826,
"logps/chosen": -294.253662109375,
"logps/rejected": -250.2303924560547,
"loss": 0.6923,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.008810626342892647,
"rewards/margins": 0.00140268518589437,
"rewards/rejected": 0.007407941855490208,
"step": 1620
},
{
"epoch": 0.29,
"learning_rate": 9.2544080604534e-08,
"logits/chosen": -2.788504123687744,
"logits/rejected": -2.818932294845581,
"logps/chosen": -204.68771362304688,
"logps/rejected": -171.62033081054688,
"loss": 0.6927,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.003130528377369046,
"rewards/margins": -0.0011326493695378304,
"rewards/rejected": 0.004263177514076233,
"step": 1630
},
{
"epoch": 0.29,
"learning_rate": 9.249370277078086e-08,
"logits/chosen": -2.75852632522583,
"logits/rejected": -2.810488700866699,
"logps/chosen": -293.2353820800781,
"logps/rejected": -233.1583709716797,
"loss": 0.693,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.005525670945644379,
"rewards/margins": 0.0027149529196321964,
"rewards/rejected": 0.002810717560350895,
"step": 1640
},
{
"epoch": 0.29,
"learning_rate": 9.24433249370277e-08,
"logits/chosen": -2.7465367317199707,
"logits/rejected": -2.7176971435546875,
"logps/chosen": -248.1861114501953,
"logps/rejected": -205.9281005859375,
"loss": 0.6924,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.007562885992228985,
"rewards/margins": 0.005088142119348049,
"rewards/rejected": 0.0024747434072196484,
"step": 1650
},
{
"epoch": 0.29,
"learning_rate": 9.239294710327455e-08,
"logits/chosen": -2.765758752822876,
"logits/rejected": -2.76737904548645,
"logps/chosen": -236.78482055664062,
"logps/rejected": -216.59408569335938,
"loss": 0.6925,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.00701189273968339,
"rewards/margins": 0.0009126948425546288,
"rewards/rejected": 0.006099197082221508,
"step": 1660
},
{
"epoch": 0.29,
"learning_rate": 9.23425692695214e-08,
"logits/chosen": -2.7198102474212646,
"logits/rejected": -2.676805257797241,
"logps/chosen": -190.41085815429688,
"logps/rejected": -199.9924774169922,
"loss": 0.6927,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.005398167297244072,
"rewards/margins": 0.0025181311648339033,
"rewards/rejected": 0.0028800363652408123,
"step": 1670
},
{
"epoch": 0.29,
"learning_rate": 9.229219143576826e-08,
"logits/chosen": -2.7450883388519287,
"logits/rejected": -2.7034592628479004,
"logps/chosen": -285.408935546875,
"logps/rejected": -261.0296936035156,
"loss": 0.6922,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.004709193948656321,
"rewards/margins": -0.00033829378662630916,
"rewards/rejected": 0.005047488491982222,
"step": 1680
},
{
"epoch": 0.3,
"learning_rate": 9.224181360201511e-08,
"logits/chosen": -2.6765735149383545,
"logits/rejected": -2.5730743408203125,
"logps/chosen": -218.64990234375,
"logps/rejected": -193.49989318847656,
"loss": 0.6929,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.005248272325843573,
"rewards/margins": 0.0031143042724579573,
"rewards/rejected": 0.002133968286216259,
"step": 1690
},
{
"epoch": 0.3,
"learning_rate": 9.219143576826196e-08,
"logits/chosen": -2.7516093254089355,
"logits/rejected": -2.796564817428589,
"logps/chosen": -259.0831298828125,
"logps/rejected": -185.15670776367188,
"loss": 0.6922,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.006098913960158825,
"rewards/margins": 0.0033921864815056324,
"rewards/rejected": 0.002706727711483836,
"step": 1700
},
{
"epoch": 0.3,
"learning_rate": 9.214105793450882e-08,
"logits/chosen": -2.8071539402008057,
"logits/rejected": -2.7718913555145264,
"logps/chosen": -237.6824188232422,
"logps/rejected": -192.46731567382812,
"loss": 0.6926,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.006562414113432169,
"rewards/margins": 0.0027120665181428194,
"rewards/rejected": 0.0038503475952893496,
"step": 1710
},
{
"epoch": 0.3,
"learning_rate": 9.209068010075567e-08,
"logits/chosen": -2.801098346710205,
"logits/rejected": -2.8045449256896973,
"logps/chosen": -306.48004150390625,
"logps/rejected": -233.9066162109375,
"loss": 0.6923,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.007683928124606609,
"rewards/margins": 0.003144733142107725,
"rewards/rejected": 0.004539194516837597,
"step": 1720
},
{
"epoch": 0.3,
"learning_rate": 9.204030226700251e-08,
"logits/chosen": -2.7108566761016846,
"logits/rejected": -2.805584669113159,
"logps/chosen": -190.70640563964844,
"logps/rejected": -164.53231811523438,
"loss": 0.6922,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.005603504832834005,
"rewards/margins": 0.0018408369505777955,
"rewards/rejected": 0.0037626686971634626,
"step": 1730
},
{
"epoch": 0.3,
"learning_rate": 9.198992443324937e-08,
"logits/chosen": -2.7416088581085205,
"logits/rejected": -2.7634804248809814,
"logps/chosen": -187.78787231445312,
"logps/rejected": -176.73611450195312,
"loss": 0.6928,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.003316228510811925,
"rewards/margins": -0.0012748127337545156,
"rewards/rejected": 0.004591041244566441,
"step": 1740
},
{
"epoch": 0.31,
"learning_rate": 9.193954659949622e-08,
"logits/chosen": -2.7573604583740234,
"logits/rejected": -2.685169219970703,
"logps/chosen": -220.46957397460938,
"logps/rejected": -186.6195831298828,
"loss": 0.6923,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.00505624245852232,
"rewards/margins": 0.0036626472137868404,
"rewards/rejected": 0.0013935946626588702,
"step": 1750
},
{
"epoch": 0.31,
"learning_rate": 9.188916876574306e-08,
"logits/chosen": -2.8284783363342285,
"logits/rejected": -2.7774031162261963,
"logps/chosen": -270.4326171875,
"logps/rejected": -247.10494995117188,
"loss": 0.6922,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.007807993330061436,
"rewards/margins": 0.003054631408303976,
"rewards/rejected": 0.004753361456096172,
"step": 1760
},
{
"epoch": 0.31,
"learning_rate": 9.183879093198991e-08,
"logits/chosen": -2.7399754524230957,
"logits/rejected": -2.783146619796753,
"logps/chosen": -237.53921508789062,
"logps/rejected": -206.88241577148438,
"loss": 0.6923,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.00769572239369154,
"rewards/margins": 0.0022291478235274553,
"rewards/rejected": 0.005466574802994728,
"step": 1770
},
{
"epoch": 0.31,
"learning_rate": 9.178841309823677e-08,
"logits/chosen": -2.716817855834961,
"logits/rejected": -2.719804286956787,
"logps/chosen": -235.63916015625,
"logps/rejected": -200.00222778320312,
"loss": 0.6924,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.006353571079671383,
"rewards/margins": 0.0007235562661662698,
"rewards/rejected": 0.00563001586124301,
"step": 1780
},
{
"epoch": 0.31,
"learning_rate": 9.173803526448362e-08,
"logits/chosen": -2.7352333068847656,
"logits/rejected": -2.7781901359558105,
"logps/chosen": -175.88961791992188,
"logps/rejected": -172.944091796875,
"loss": 0.6924,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.005051255226135254,
"rewards/margins": 0.00013072407455183566,
"rewards/rejected": 0.004920531529933214,
"step": 1790
},
{
"epoch": 0.32,
"learning_rate": 9.168765743073047e-08,
"logits/chosen": -2.737471342086792,
"logits/rejected": -2.71102237701416,
"logps/chosen": -250.81787109375,
"logps/rejected": -211.5341796875,
"loss": 0.6923,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.007261678576469421,
"rewards/margins": 0.0013637794181704521,
"rewards/rejected": 0.005897899158298969,
"step": 1800
},
{
"epoch": 0.32,
"learning_rate": 9.163727959697733e-08,
"logits/chosen": -2.7573001384735107,
"logits/rejected": -2.777223587036133,
"logps/chosen": -223.52700805664062,
"logps/rejected": -224.9475860595703,
"loss": 0.6925,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.005940387956798077,
"rewards/margins": 0.002223807852715254,
"rewards/rejected": 0.003716580104082823,
"step": 1810
},
{
"epoch": 0.32,
"learning_rate": 9.158690176322418e-08,
"logits/chosen": -2.7546377182006836,
"logits/rejected": -2.8038830757141113,
"logps/chosen": -210.6802215576172,
"logps/rejected": -191.94479370117188,
"loss": 0.6928,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.005436464212834835,
"rewards/margins": -0.0017134780064225197,
"rewards/rejected": 0.007149942219257355,
"step": 1820
},
{
"epoch": 0.32,
"learning_rate": 9.153652392947104e-08,
"logits/chosen": -2.793966293334961,
"logits/rejected": -2.84097957611084,
"logps/chosen": -275.74078369140625,
"logps/rejected": -247.7950439453125,
"loss": 0.6932,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.006203091703355312,
"rewards/margins": 0.0017260663444176316,
"rewards/rejected": 0.004477024544030428,
"step": 1830
},
{
"epoch": 0.32,
"learning_rate": 9.148614609571788e-08,
"logits/chosen": -2.7271361351013184,
"logits/rejected": -2.8027615547180176,
"logps/chosen": -197.15615844726562,
"logps/rejected": -185.2477264404297,
"loss": 0.6925,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.004695483483374119,
"rewards/margins": -0.0009570989641360939,
"rewards/rejected": 0.00565258227288723,
"step": 1840
},
{
"epoch": 0.32,
"learning_rate": 9.143576826196473e-08,
"logits/chosen": -2.6608946323394775,
"logits/rejected": -2.6794865131378174,
"logps/chosen": -248.6991729736328,
"logps/rejected": -243.78225708007812,
"loss": 0.6925,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.006408816669136286,
"rewards/margins": -0.0003214823664166033,
"rewards/rejected": 0.0067302994430065155,
"step": 1850
},
{
"epoch": 0.33,
"learning_rate": 9.138539042821158e-08,
"logits/chosen": -2.7787938117980957,
"logits/rejected": -2.773528575897217,
"logps/chosen": -276.1280212402344,
"logps/rejected": -227.1744842529297,
"loss": 0.6927,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.009555719792842865,
"rewards/margins": 0.003407822223380208,
"rewards/rejected": 0.006147897802293301,
"step": 1860
},
{
"epoch": 0.33,
"learning_rate": 9.133501259445844e-08,
"logits/chosen": -2.759768009185791,
"logits/rejected": -2.7878026962280273,
"logps/chosen": -282.8551330566406,
"logps/rejected": -236.4971160888672,
"loss": 0.6929,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.007030332926660776,
"rewards/margins": 0.0005596103728748858,
"rewards/rejected": 0.006470722146332264,
"step": 1870
},
{
"epoch": 0.33,
"learning_rate": 9.128463476070528e-08,
"logits/chosen": -2.7400457859039307,
"logits/rejected": -2.7290937900543213,
"logps/chosen": -228.9811248779297,
"logps/rejected": -190.52259826660156,
"loss": 0.6921,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.008042901754379272,
"rewards/margins": 0.004830832127481699,
"rewards/rejected": 0.00321206939406693,
"step": 1880
},
{
"epoch": 0.33,
"learning_rate": 9.123425692695213e-08,
"logits/chosen": -2.7177040576934814,
"logits/rejected": -2.746002197265625,
"logps/chosen": -208.7105255126953,
"logps/rejected": -178.6358642578125,
"loss": 0.6924,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.008034145459532738,
"rewards/margins": 0.0038532826583832502,
"rewards/rejected": 0.0041808634996414185,
"step": 1890
},
{
"epoch": 0.33,
"learning_rate": 9.118387909319898e-08,
"logits/chosen": -2.7194418907165527,
"logits/rejected": -2.7867624759674072,
"logps/chosen": -260.50518798828125,
"logps/rejected": -232.93331909179688,
"loss": 0.6923,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.009059436619281769,
"rewards/margins": 0.0009833091171458364,
"rewards/rejected": 0.008076125755906105,
"step": 1900
},
{
"epoch": 0.33,
"learning_rate": 9.113350125944584e-08,
"logits/chosen": -2.6974074840545654,
"logits/rejected": -2.720205545425415,
"logps/chosen": -229.29800415039062,
"logps/rejected": -222.5083465576172,
"loss": 0.6927,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.006830728612840176,
"rewards/margins": 9.487769420957193e-05,
"rewards/rejected": 0.006735851056873798,
"step": 1910
},
{
"epoch": 0.34,
"learning_rate": 9.108312342569269e-08,
"logits/chosen": -2.682278633117676,
"logits/rejected": -2.689655303955078,
"logps/chosen": -262.4538879394531,
"logps/rejected": -208.20834350585938,
"loss": 0.6922,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.008090605027973652,
"rewards/margins": 0.005382605362683535,
"rewards/rejected": 0.0027079996652901173,
"step": 1920
},
{
"epoch": 0.34,
"learning_rate": 9.103274559193955e-08,
"logits/chosen": -2.655890703201294,
"logits/rejected": -2.764970541000366,
"logps/chosen": -277.8880310058594,
"logps/rejected": -202.5020751953125,
"loss": 0.6928,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.007924163714051247,
"rewards/margins": 0.0037231750320643187,
"rewards/rejected": 0.004200988449156284,
"step": 1930
},
{
"epoch": 0.34,
"learning_rate": 9.09823677581864e-08,
"logits/chosen": -2.7730414867401123,
"logits/rejected": -2.708861827850342,
"logps/chosen": -233.4267578125,
"logps/rejected": -205.75045776367188,
"loss": 0.6928,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.007474385201931,
"rewards/margins": 0.0025435371790081263,
"rewards/rejected": 0.00493084779009223,
"step": 1940
},
{
"epoch": 0.34,
"learning_rate": 9.093198992443325e-08,
"logits/chosen": -2.7270901203155518,
"logits/rejected": -2.7830066680908203,
"logps/chosen": -269.06103515625,
"logps/rejected": -233.0624237060547,
"loss": 0.6924,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.006805942859500647,
"rewards/margins": 0.002863366389647126,
"rewards/rejected": 0.003942577634006739,
"step": 1950
},
{
"epoch": 0.34,
"learning_rate": 9.088161209068009e-08,
"logits/chosen": -2.756842851638794,
"logits/rejected": -2.7270755767822266,
"logps/chosen": -205.07064819335938,
"logps/rejected": -199.98719787597656,
"loss": 0.6924,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.006842183880507946,
"rewards/margins": 0.0016147240530699492,
"rewards/rejected": 0.0052274600602686405,
"step": 1960
},
{
"epoch": 0.35,
"learning_rate": 9.083123425692695e-08,
"logits/chosen": -2.772458076477051,
"logits/rejected": -2.720886707305908,
"logps/chosen": -222.73904418945312,
"logps/rejected": -192.80467224121094,
"loss": 0.6925,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.008435122668743134,
"rewards/margins": 0.0015853416407480836,
"rewards/rejected": 0.006849782075732946,
"step": 1970
},
{
"epoch": 0.35,
"learning_rate": 9.07808564231738e-08,
"logits/chosen": -2.8323588371276855,
"logits/rejected": -2.757342576980591,
"logps/chosen": -221.9827117919922,
"logps/rejected": -206.13693237304688,
"loss": 0.6925,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.006544102914631367,
"rewards/margins": 0.0011714848224073648,
"rewards/rejected": 0.005372617393732071,
"step": 1980
},
{
"epoch": 0.35,
"learning_rate": 9.073047858942065e-08,
"logits/chosen": -2.839995861053467,
"logits/rejected": -2.778444290161133,
"logps/chosen": -198.0923309326172,
"logps/rejected": -185.09725952148438,
"loss": 0.692,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.00797742698341608,
"rewards/margins": 0.0033867559395730495,
"rewards/rejected": 0.004590670112520456,
"step": 1990
},
{
"epoch": 0.35,
"learning_rate": 9.06801007556675e-08,
"logits/chosen": -2.7065186500549316,
"logits/rejected": -2.6786417961120605,
"logps/chosen": -200.3252716064453,
"logps/rejected": -174.55252075195312,
"loss": 0.6927,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0027497578412294388,
"rewards/margins": 0.00032762327464297414,
"rewards/rejected": 0.002422134391963482,
"step": 2000
},
{
"epoch": 0.35,
"learning_rate": 9.062972292191435e-08,
"logits/chosen": -2.8198843002319336,
"logits/rejected": -2.72586727142334,
"logps/chosen": -250.848388671875,
"logps/rejected": -223.4097900390625,
"loss": 0.692,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.010807116515934467,
"rewards/margins": 0.0031298950780183077,
"rewards/rejected": 0.007677220739424229,
"step": 2010
},
{
"epoch": 0.35,
"learning_rate": 9.05793450881612e-08,
"logits/chosen": -2.7961342334747314,
"logits/rejected": -2.793257713317871,
"logps/chosen": -228.30099487304688,
"logps/rejected": -172.77639770507812,
"loss": 0.6922,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.00609872629866004,
"rewards/margins": 0.0020499066449701786,
"rewards/rejected": 0.004048819653689861,
"step": 2020
},
{
"epoch": 0.36,
"learning_rate": 9.052896725440806e-08,
"logits/chosen": -2.773071765899658,
"logits/rejected": -2.726912260055542,
"logps/chosen": -210.5772705078125,
"logps/rejected": -182.91647338867188,
"loss": 0.6918,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.008080719970166683,
"rewards/margins": 0.002562993671745062,
"rewards/rejected": 0.005517727229744196,
"step": 2030
},
{
"epoch": 0.36,
"learning_rate": 9.047858942065491e-08,
"logits/chosen": -2.694596767425537,
"logits/rejected": -2.707979917526245,
"logps/chosen": -219.9010772705078,
"logps/rejected": -220.4337158203125,
"loss": 0.6923,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.007597730960696936,
"rewards/margins": -0.0006745406426489353,
"rewards/rejected": 0.008272271603345871,
"step": 2040
},
{
"epoch": 0.36,
"learning_rate": 9.042821158690176e-08,
"logits/chosen": -2.823132276535034,
"logits/rejected": -2.8142189979553223,
"logps/chosen": -229.84036254882812,
"logps/rejected": -180.3568572998047,
"loss": 0.6922,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.00825478509068489,
"rewards/margins": 0.00363583629950881,
"rewards/rejected": 0.004618949256837368,
"step": 2050
},
{
"epoch": 0.36,
"learning_rate": 9.037783375314862e-08,
"logits/chosen": -2.7286908626556396,
"logits/rejected": -2.7378149032592773,
"logps/chosen": -174.80532836914062,
"logps/rejected": -159.1217803955078,
"loss": 0.6924,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.005188413895666599,
"rewards/margins": 0.001207556575536728,
"rewards/rejected": 0.003980856854468584,
"step": 2060
},
{
"epoch": 0.36,
"learning_rate": 9.032745591939546e-08,
"logits/chosen": -2.7917840480804443,
"logits/rejected": -2.7678382396698,
"logps/chosen": -211.1044921875,
"logps/rejected": -186.33775329589844,
"loss": 0.6922,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.006869046948850155,
"rewards/margins": 0.002652390394359827,
"rewards/rejected": 0.004216657020151615,
"step": 2070
},
{
"epoch": 0.36,
"learning_rate": 9.027707808564231e-08,
"logits/chosen": -2.773383617401123,
"logits/rejected": -2.7457468509674072,
"logps/chosen": -196.5582733154297,
"logps/rejected": -157.29763793945312,
"loss": 0.6931,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.004717974923551083,
"rewards/margins": -0.0003334479406476021,
"rewards/rejected": 0.005051423329859972,
"step": 2080
},
{
"epoch": 0.37,
"learning_rate": 9.022670025188916e-08,
"logits/chosen": -2.829695224761963,
"logits/rejected": -2.8286352157592773,
"logps/chosen": -257.33575439453125,
"logps/rejected": -222.24081420898438,
"loss": 0.693,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.008855994790792465,
"rewards/margins": -0.0004033507429994643,
"rewards/rejected": 0.009259345009922981,
"step": 2090
},
{
"epoch": 0.37,
"learning_rate": 9.017632241813602e-08,
"logits/chosen": -2.6822662353515625,
"logits/rejected": -2.7216250896453857,
"logps/chosen": -204.204345703125,
"logps/rejected": -213.64120483398438,
"loss": 0.6925,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.005887551233172417,
"rewards/margins": -0.001325045945122838,
"rewards/rejected": 0.007212596945464611,
"step": 2100
},
{
"epoch": 0.37,
"learning_rate": 9.012594458438286e-08,
"logits/chosen": -2.717801332473755,
"logits/rejected": -2.6509881019592285,
"logps/chosen": -201.35829162597656,
"logps/rejected": -204.86557006835938,
"loss": 0.6931,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.005306928418576717,
"rewards/margins": -0.0017324115615338087,
"rewards/rejected": 0.007039339747279882,
"step": 2110
},
{
"epoch": 0.37,
"learning_rate": 9.007556675062971e-08,
"logits/chosen": -2.7330944538116455,
"logits/rejected": -2.7502284049987793,
"logps/chosen": -235.6743621826172,
"logps/rejected": -227.54446411132812,
"loss": 0.6923,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.007282434497028589,
"rewards/margins": 0.0004998206277377903,
"rewards/rejected": 0.006782613694667816,
"step": 2120
},
{
"epoch": 0.37,
"learning_rate": 9.002518891687657e-08,
"logits/chosen": -2.7793288230895996,
"logits/rejected": -2.7879912853240967,
"logps/chosen": -244.0114288330078,
"logps/rejected": -195.60763549804688,
"loss": 0.6928,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.00913340412080288,
"rewards/margins": 0.002795944456011057,
"rewards/rejected": 0.006337459199130535,
"step": 2130
},
{
"epoch": 0.37,
"learning_rate": 8.997481108312342e-08,
"logits/chosen": -2.770501136779785,
"logits/rejected": -2.75308895111084,
"logps/chosen": -263.10198974609375,
"logps/rejected": -227.291015625,
"loss": 0.6928,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.005692030768841505,
"rewards/margins": -0.001495410455390811,
"rewards/rejected": 0.007187440060079098,
"step": 2140
},
{
"epoch": 0.38,
"learning_rate": 8.992443324937027e-08,
"logits/chosen": -2.722250461578369,
"logits/rejected": -2.782747745513916,
"logps/chosen": -217.0636444091797,
"logps/rejected": -190.8524627685547,
"loss": 0.6923,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.0067198313772678375,
"rewards/margins": 0.00041137990774586797,
"rewards/rejected": 0.006308451294898987,
"step": 2150
},
{
"epoch": 0.38,
"learning_rate": 8.987405541561713e-08,
"logits/chosen": -2.792790651321411,
"logits/rejected": -2.831502676010132,
"logps/chosen": -235.6027069091797,
"logps/rejected": -213.80899047851562,
"loss": 0.6922,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.006459805183112621,
"rewards/margins": 0.0006882447050884366,
"rewards/rejected": 0.005771561060100794,
"step": 2160
},
{
"epoch": 0.38,
"learning_rate": 8.982367758186398e-08,
"logits/chosen": -2.6963181495666504,
"logits/rejected": -2.763627529144287,
"logps/chosen": -216.1712646484375,
"logps/rejected": -189.81759643554688,
"loss": 0.6921,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.008661460131406784,
"rewards/margins": 0.00203773588873446,
"rewards/rejected": 0.006623723544180393,
"step": 2170
},
{
"epoch": 0.38,
"learning_rate": 8.977329974811083e-08,
"logits/chosen": -2.735170364379883,
"logits/rejected": -2.7084457874298096,
"logps/chosen": -182.16720581054688,
"logps/rejected": -163.56094360351562,
"loss": 0.6927,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.008674652315676212,
"rewards/margins": 0.003342932555824518,
"rewards/rejected": 0.0053317188285291195,
"step": 2180
},
{
"epoch": 0.38,
"learning_rate": 8.972292191435767e-08,
"logits/chosen": -2.750704288482666,
"logits/rejected": -2.779202938079834,
"logps/chosen": -241.536865234375,
"logps/rejected": -190.92633056640625,
"loss": 0.6928,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.010668774135410786,
"rewards/margins": 0.0013826647773385048,
"rewards/rejected": 0.009286109358072281,
"step": 2190
},
{
"epoch": 0.39,
"learning_rate": 8.967254408060453e-08,
"logits/chosen": -2.7246861457824707,
"logits/rejected": -2.675992488861084,
"logps/chosen": -223.83837890625,
"logps/rejected": -188.50747680664062,
"loss": 0.6919,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.007452371530234814,
"rewards/margins": -0.0014652060344815254,
"rewards/rejected": 0.008917578496038914,
"step": 2200
},
{
"epoch": 0.39,
"learning_rate": 8.962216624685138e-08,
"logits/chosen": -2.7461745738983154,
"logits/rejected": -2.690744400024414,
"logps/chosen": -201.64651489257812,
"logps/rejected": -210.37405395507812,
"loss": 0.6927,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.005704388953745365,
"rewards/margins": -0.00024541860329918563,
"rewards/rejected": 0.005949807353317738,
"step": 2210
},
{
"epoch": 0.39,
"learning_rate": 8.957178841309823e-08,
"logits/chosen": -2.8038201332092285,
"logits/rejected": -2.75268816947937,
"logps/chosen": -254.98904418945312,
"logps/rejected": -221.23080444335938,
"loss": 0.6925,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.009008856490254402,
"rewards/margins": 0.0005879864911548793,
"rewards/rejected": 0.008420869708061218,
"step": 2220
},
{
"epoch": 0.39,
"learning_rate": 8.952141057934508e-08,
"logits/chosen": -2.804844617843628,
"logits/rejected": -2.805863380432129,
"logps/chosen": -242.4755859375,
"logps/rejected": -208.1300048828125,
"loss": 0.6921,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.008145569823682308,
"rewards/margins": 0.0016121035441756248,
"rewards/rejected": 0.006533467210829258,
"step": 2230
},
{
"epoch": 0.39,
"learning_rate": 8.947103274559193e-08,
"logits/chosen": -2.7161951065063477,
"logits/rejected": -2.6106388568878174,
"logps/chosen": -236.38534545898438,
"logps/rejected": -237.8708038330078,
"loss": 0.6921,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.01004200428724289,
"rewards/margins": 0.004435664042830467,
"rewards/rejected": 0.0056063407100737095,
"step": 2240
},
{
"epoch": 0.39,
"learning_rate": 8.942065491183878e-08,
"logits/chosen": -2.7104029655456543,
"logits/rejected": -2.7299609184265137,
"logps/chosen": -244.9352569580078,
"logps/rejected": -201.58877563476562,
"loss": 0.6926,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.008890941739082336,
"rewards/margins": 0.0025217377115041018,
"rewards/rejected": 0.006369204260408878,
"step": 2250
},
{
"epoch": 0.4,
"learning_rate": 8.937027707808565e-08,
"logits/chosen": -2.7342441082000732,
"logits/rejected": -2.7766692638397217,
"logps/chosen": -249.001708984375,
"logps/rejected": -195.75601196289062,
"loss": 0.6924,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.011680737137794495,
"rewards/margins": 0.007096041925251484,
"rewards/rejected": 0.004584694746881723,
"step": 2260
},
{
"epoch": 0.4,
"learning_rate": 8.931989924433249e-08,
"logits/chosen": -2.7314367294311523,
"logits/rejected": -2.751647472381592,
"logps/chosen": -257.7462158203125,
"logps/rejected": -192.61325073242188,
"loss": 0.6914,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.009932273998856544,
"rewards/margins": 0.002873816527426243,
"rewards/rejected": 0.007058457471430302,
"step": 2270
},
{
"epoch": 0.4,
"learning_rate": 8.926952141057934e-08,
"logits/chosen": -2.7829346656799316,
"logits/rejected": -2.6927618980407715,
"logps/chosen": -214.0055389404297,
"logps/rejected": -167.7479705810547,
"loss": 0.6918,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.01033037155866623,
"rewards/margins": 0.006925082765519619,
"rewards/rejected": 0.003405289025977254,
"step": 2280
},
{
"epoch": 0.4,
"learning_rate": 8.92191435768262e-08,
"logits/chosen": -2.7139039039611816,
"logits/rejected": -2.74005389213562,
"logps/chosen": -240.3031768798828,
"logps/rejected": -191.8223419189453,
"loss": 0.6925,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.006939934100955725,
"rewards/margins": 0.0009533121483400464,
"rewards/rejected": 0.0059866225346922874,
"step": 2290
},
{
"epoch": 0.4,
"learning_rate": 8.916876574307305e-08,
"logits/chosen": -2.7282981872558594,
"logits/rejected": -2.712113380432129,
"logps/chosen": -237.7392578125,
"logps/rejected": -224.4556427001953,
"loss": 0.692,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.010463756509125233,
"rewards/margins": 0.004110955633223057,
"rewards/rejected": 0.006352802272886038,
"step": 2300
},
{
"epoch": 0.4,
"learning_rate": 8.911838790931989e-08,
"logits/chosen": -2.7684943675994873,
"logits/rejected": -2.7373266220092773,
"logps/chosen": -206.5482635498047,
"logps/rejected": -212.13406372070312,
"loss": 0.6925,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.006885471288114786,
"rewards/margins": -0.002132121007889509,
"rewards/rejected": 0.009017592296004295,
"step": 2310
},
{
"epoch": 0.41,
"learning_rate": 8.906801007556674e-08,
"logits/chosen": -2.805568218231201,
"logits/rejected": -2.8355040550231934,
"logps/chosen": -275.70587158203125,
"logps/rejected": -209.14218139648438,
"loss": 0.6926,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.007967405952513218,
"rewards/margins": 0.002225789474323392,
"rewards/rejected": 0.00574161671102047,
"step": 2320
},
{
"epoch": 0.41,
"learning_rate": 8.90176322418136e-08,
"logits/chosen": -2.7412164211273193,
"logits/rejected": -2.7422406673431396,
"logps/chosen": -244.7394256591797,
"logps/rejected": -208.07717895507812,
"loss": 0.6924,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.00783600378781557,
"rewards/margins": 0.0005075406515970826,
"rewards/rejected": 0.007328461855649948,
"step": 2330
},
{
"epoch": 0.41,
"learning_rate": 8.896725440806045e-08,
"logits/chosen": -2.8028624057769775,
"logits/rejected": -2.796525716781616,
"logps/chosen": -272.66632080078125,
"logps/rejected": -222.811279296875,
"loss": 0.6921,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.010351276025176048,
"rewards/margins": 0.0018881557043641806,
"rewards/rejected": 0.008463121019303799,
"step": 2340
},
{
"epoch": 0.41,
"learning_rate": 8.891687657430729e-08,
"logits/chosen": -2.6541576385498047,
"logits/rejected": -2.686614751815796,
"logps/chosen": -231.4371337890625,
"logps/rejected": -216.7913818359375,
"loss": 0.6924,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.0074166180565953255,
"rewards/margins": -0.0016186184948310256,
"rewards/rejected": 0.009035235270857811,
"step": 2350
},
{
"epoch": 0.41,
"learning_rate": 8.886649874055415e-08,
"logits/chosen": -2.631671190261841,
"logits/rejected": -2.760439395904541,
"logps/chosen": -225.0189666748047,
"logps/rejected": -235.6808624267578,
"loss": 0.6929,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.007628731429576874,
"rewards/margins": -0.00035653618397191167,
"rewards/rejected": 0.007985267788171768,
"step": 2360
},
{
"epoch": 0.42,
"learning_rate": 8.881612090680101e-08,
"logits/chosen": -2.6786155700683594,
"logits/rejected": -2.7173733711242676,
"logps/chosen": -220.6988983154297,
"logps/rejected": -195.98582458496094,
"loss": 0.6922,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.009033399634063244,
"rewards/margins": 0.0017579678678885102,
"rewards/rejected": 0.007275431416928768,
"step": 2370
},
{
"epoch": 0.42,
"learning_rate": 8.876574307304785e-08,
"logits/chosen": -2.774136543273926,
"logits/rejected": -2.6647706031799316,
"logps/chosen": -304.55181884765625,
"logps/rejected": -307.3960876464844,
"loss": 0.6923,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.012085049413144588,
"rewards/margins": 0.0007154010236263275,
"rewards/rejected": 0.01136965025216341,
"step": 2380
},
{
"epoch": 0.42,
"learning_rate": 8.871536523929471e-08,
"logits/chosen": -2.6545538902282715,
"logits/rejected": -2.752094030380249,
"logps/chosen": -250.7977752685547,
"logps/rejected": -221.78964233398438,
"loss": 0.6922,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.008444622159004211,
"rewards/margins": 0.0009982278570532799,
"rewards/rejected": 0.0074463943019509315,
"step": 2390
},
{
"epoch": 0.42,
"learning_rate": 8.866498740554156e-08,
"logits/chosen": -2.7769970893859863,
"logits/rejected": -2.749866485595703,
"logps/chosen": -210.654541015625,
"logps/rejected": -191.4696807861328,
"loss": 0.6921,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.008832408115267754,
"rewards/margins": -0.0005183859029784799,
"rewards/rejected": 0.009350794367492199,
"step": 2400
},
{
"epoch": 0.42,
"learning_rate": 8.861460957178841e-08,
"logits/chosen": -2.697442054748535,
"logits/rejected": -2.7253782749176025,
"logps/chosen": -220.7960968017578,
"logps/rejected": -217.39108276367188,
"loss": 0.6921,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.0069009833969175816,
"rewards/margins": -0.0006977998418733478,
"rewards/rejected": 0.007598782889544964,
"step": 2410
},
{
"epoch": 0.42,
"learning_rate": 8.856423173803525e-08,
"logits/chosen": -2.7221148014068604,
"logits/rejected": -2.731081962585449,
"logps/chosen": -213.35916137695312,
"logps/rejected": -180.56887817382812,
"loss": 0.6921,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.006449718959629536,
"rewards/margins": 0.00094635970890522,
"rewards/rejected": 0.005503358785063028,
"step": 2420
},
{
"epoch": 0.43,
"learning_rate": 8.851385390428211e-08,
"logits/chosen": -2.726142644882202,
"logits/rejected": -2.7781872749328613,
"logps/chosen": -233.19851684570312,
"logps/rejected": -214.63565063476562,
"loss": 0.6923,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.009057990275323391,
"rewards/margins": 0.00277666375041008,
"rewards/rejected": 0.006281326524913311,
"step": 2430
},
{
"epoch": 0.43,
"learning_rate": 8.846347607052896e-08,
"logits/chosen": -2.721498966217041,
"logits/rejected": -2.74996018409729,
"logps/chosen": -246.1979217529297,
"logps/rejected": -196.91104125976562,
"loss": 0.6918,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.009174585342407227,
"rewards/margins": 0.002294916193932295,
"rewards/rejected": 0.00687966775149107,
"step": 2440
},
{
"epoch": 0.43,
"learning_rate": 8.841309823677582e-08,
"logits/chosen": -2.7128663063049316,
"logits/rejected": -2.6650452613830566,
"logps/chosen": -206.5331573486328,
"logps/rejected": -173.64071655273438,
"loss": 0.6924,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.007573836483061314,
"rewards/margins": 0.0018665831303223968,
"rewards/rejected": 0.005707253236323595,
"step": 2450
},
{
"epoch": 0.43,
"learning_rate": 8.836272040302266e-08,
"logits/chosen": -2.788109302520752,
"logits/rejected": -2.7255702018737793,
"logps/chosen": -243.81491088867188,
"logps/rejected": -197.00755310058594,
"loss": 0.6926,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.010449462570250034,
"rewards/margins": 0.003042304888367653,
"rewards/rejected": 0.007407157216221094,
"step": 2460
},
{
"epoch": 0.43,
"learning_rate": 8.831234256926951e-08,
"logits/chosen": -2.745732307434082,
"logits/rejected": -2.720219135284424,
"logps/chosen": -210.3990478515625,
"logps/rejected": -215.95071411132812,
"loss": 0.6925,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.007016859017312527,
"rewards/margins": 0.0003235770855098963,
"rewards/rejected": 0.006693282164633274,
"step": 2470
},
{
"epoch": 0.43,
"learning_rate": 8.826196473551638e-08,
"logits/chosen": -2.744358539581299,
"logits/rejected": -2.735334873199463,
"logps/chosen": -184.0402374267578,
"logps/rejected": -155.08839416503906,
"loss": 0.6924,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": 0.00902140885591507,
"rewards/margins": 0.004157154820859432,
"rewards/rejected": 0.004864254035055637,
"step": 2480
},
{
"epoch": 0.44,
"learning_rate": 8.821158690176323e-08,
"logits/chosen": -2.7525582313537598,
"logits/rejected": -2.7596418857574463,
"logps/chosen": -218.2732391357422,
"logps/rejected": -201.02366638183594,
"loss": 0.6921,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.01294918917119503,
"rewards/margins": 0.0058312080800533295,
"rewards/rejected": 0.00711798295378685,
"step": 2490
},
{
"epoch": 0.44,
"learning_rate": 8.816120906801007e-08,
"logits/chosen": -2.754030466079712,
"logits/rejected": -2.7371068000793457,
"logps/chosen": -214.6430206298828,
"logps/rejected": -185.87380981445312,
"loss": 0.6921,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.01002354547381401,
"rewards/margins": 0.0026681842282414436,
"rewards/rejected": 0.00735536077991128,
"step": 2500
},
{
"epoch": 0.44,
"learning_rate": 8.811083123425692e-08,
"logits/chosen": -2.768505096435547,
"logits/rejected": -2.7552056312561035,
"logps/chosen": -227.3952178955078,
"logps/rejected": -212.49172973632812,
"loss": 0.6925,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.008513586595654488,
"rewards/margins": 0.001957664964720607,
"rewards/rejected": 0.006555921398103237,
"step": 2510
},
{
"epoch": 0.44,
"learning_rate": 8.806045340050378e-08,
"logits/chosen": -2.7537245750427246,
"logits/rejected": -2.755566120147705,
"logps/chosen": -294.26031494140625,
"logps/rejected": -249.40060424804688,
"loss": 0.6924,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.014117250218987465,
"rewards/margins": 0.0032351291738450527,
"rewards/rejected": 0.0108821215108037,
"step": 2520
},
{
"epoch": 0.44,
"learning_rate": 8.801007556675063e-08,
"logits/chosen": -2.787724018096924,
"logits/rejected": -2.756760835647583,
"logps/chosen": -284.3551330566406,
"logps/rejected": -223.2763671875,
"loss": 0.6927,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.009325772523880005,
"rewards/margins": 0.0031861222814768553,
"rewards/rejected": 0.006139650940895081,
"step": 2530
},
{
"epoch": 0.44,
"learning_rate": 8.795969773299747e-08,
"logits/chosen": -2.672646999359131,
"logits/rejected": -2.7240772247314453,
"logps/chosen": -194.29666137695312,
"logps/rejected": -166.72015380859375,
"loss": 0.6921,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.009259345009922981,
"rewards/margins": 0.002904356922954321,
"rewards/rejected": 0.006354988552629948,
"step": 2540
},
{
"epoch": 0.45,
"learning_rate": 8.790931989924433e-08,
"logits/chosen": -2.6944260597229004,
"logits/rejected": -2.743349552154541,
"logps/chosen": -232.59182739257812,
"logps/rejected": -204.32626342773438,
"loss": 0.6916,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.010777676478028297,
"rewards/margins": 0.002251842524856329,
"rewards/rejected": 0.00852583535015583,
"step": 2550
},
{
"epoch": 0.45,
"learning_rate": 8.785894206549118e-08,
"logits/chosen": -2.6557891368865967,
"logits/rejected": -2.734790325164795,
"logps/chosen": -276.6233825683594,
"logps/rejected": -263.9059753417969,
"loss": 0.6928,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.011154399253427982,
"rewards/margins": 0.002435199683532119,
"rewards/rejected": 0.008719200268387794,
"step": 2560
},
{
"epoch": 0.45,
"learning_rate": 8.780856423173803e-08,
"logits/chosen": -2.7870709896087646,
"logits/rejected": -2.7531352043151855,
"logps/chosen": -197.4013671875,
"logps/rejected": -182.07659912109375,
"loss": 0.693,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.008912255987524986,
"rewards/margins": 0.00424787774682045,
"rewards/rejected": 0.004664379172027111,
"step": 2570
},
{
"epoch": 0.45,
"learning_rate": 8.775818639798487e-08,
"logits/chosen": -2.7127013206481934,
"logits/rejected": -2.784416437149048,
"logps/chosen": -247.58114624023438,
"logps/rejected": -234.8740997314453,
"loss": 0.6924,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.00897514633834362,
"rewards/margins": 0.0012818890390917659,
"rewards/rejected": 0.0076932585798203945,
"step": 2580
},
{
"epoch": 0.45,
"learning_rate": 8.770780856423174e-08,
"logits/chosen": -2.750242233276367,
"logits/rejected": -2.770826578140259,
"logps/chosen": -231.67666625976562,
"logps/rejected": -193.50149536132812,
"loss": 0.6921,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.007797654718160629,
"rewards/margins": 0.0008120322600007057,
"rewards/rejected": 0.006985623389482498,
"step": 2590
},
{
"epoch": 0.46,
"learning_rate": 8.765743073047859e-08,
"logits/chosen": -2.7939043045043945,
"logits/rejected": -2.732703685760498,
"logps/chosen": -181.970458984375,
"logps/rejected": -197.69735717773438,
"loss": 0.6921,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.008163347840309143,
"rewards/margins": 3.1356001272797585e-05,
"rewards/rejected": 0.00813199020922184,
"step": 2600
},
{
"epoch": 0.46,
"learning_rate": 8.760705289672545e-08,
"logits/chosen": -2.7721047401428223,
"logits/rejected": -2.727365016937256,
"logps/chosen": -208.9429473876953,
"logps/rejected": -212.2381134033203,
"loss": 0.6921,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.008429192937910557,
"rewards/margins": 0.002313527511432767,
"rewards/rejected": 0.006115665193647146,
"step": 2610
},
{
"epoch": 0.46,
"learning_rate": 8.755667506297229e-08,
"logits/chosen": -2.7597005367279053,
"logits/rejected": -2.754197597503662,
"logps/chosen": -199.6351318359375,
"logps/rejected": -197.25167846679688,
"loss": 0.6919,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.008318079635500908,
"rewards/margins": -0.001612034859135747,
"rewards/rejected": 0.009930115193128586,
"step": 2620
},
{
"epoch": 0.46,
"learning_rate": 8.750629722921914e-08,
"logits/chosen": -2.7147693634033203,
"logits/rejected": -2.7820794582366943,
"logps/chosen": -217.3456573486328,
"logps/rejected": -171.41885375976562,
"loss": 0.6921,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.007606199476867914,
"rewards/margins": -0.00042509473860263824,
"rewards/rejected": 0.008031293749809265,
"step": 2630
},
{
"epoch": 0.46,
"learning_rate": 8.7455919395466e-08,
"logits/chosen": -2.7982594966888428,
"logits/rejected": -2.821972608566284,
"logps/chosen": -213.735107421875,
"logps/rejected": -194.77943420410156,
"loss": 0.6923,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.007399165071547031,
"rewards/margins": 0.0010075327008962631,
"rewards/rejected": 0.006391631904989481,
"step": 2640
},
{
"epoch": 0.46,
"learning_rate": 8.740554156171285e-08,
"logits/chosen": -2.8446202278137207,
"logits/rejected": -2.813603162765503,
"logps/chosen": -252.73654174804688,
"logps/rejected": -244.2529754638672,
"loss": 0.6924,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.012703513726592064,
"rewards/margins": 0.0044145723804831505,
"rewards/rejected": 0.008288940414786339,
"step": 2650
},
{
"epoch": 0.47,
"learning_rate": 8.735516372795969e-08,
"logits/chosen": -2.6939728260040283,
"logits/rejected": -2.7148683071136475,
"logps/chosen": -245.3076629638672,
"logps/rejected": -201.79263305664062,
"loss": 0.6918,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.012571310624480247,
"rewards/margins": 0.004034299403429031,
"rewards/rejected": 0.008537010289728642,
"step": 2660
},
{
"epoch": 0.47,
"learning_rate": 8.730478589420654e-08,
"logits/chosen": -2.7818963527679443,
"logits/rejected": -2.770908832550049,
"logps/chosen": -262.9079895019531,
"logps/rejected": -277.7655334472656,
"loss": 0.6919,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.013273214921355247,
"rewards/margins": 0.003978852182626724,
"rewards/rejected": 0.009294363670051098,
"step": 2670
},
{
"epoch": 0.47,
"learning_rate": 8.72544080604534e-08,
"logits/chosen": -2.766702651977539,
"logits/rejected": -2.7301106452941895,
"logps/chosen": -262.9296875,
"logps/rejected": -208.35519409179688,
"loss": 0.6917,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.012347053736448288,
"rewards/margins": 0.004885281436145306,
"rewards/rejected": 0.007461773697286844,
"step": 2680
},
{
"epoch": 0.47,
"learning_rate": 8.720403022670024e-08,
"logits/chosen": -2.7742788791656494,
"logits/rejected": -2.7576308250427246,
"logps/chosen": -204.61465454101562,
"logps/rejected": -202.59237670898438,
"loss": 0.6927,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": 0.008512269705533981,
"rewards/margins": -0.0016176451463252306,
"rewards/rejected": 0.010129915550351143,
"step": 2690
},
{
"epoch": 0.47,
"learning_rate": 8.71536523929471e-08,
"logits/chosen": -2.7163846492767334,
"logits/rejected": -2.8089888095855713,
"logps/chosen": -248.59158325195312,
"logps/rejected": -242.52670288085938,
"loss": 0.692,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.012646988034248352,
"rewards/margins": 0.0014709432143718004,
"rewards/rejected": 0.011176046915352345,
"step": 2700
},
{
"epoch": 0.47,
"learning_rate": 8.710327455919396e-08,
"logits/chosen": -2.7283523082733154,
"logits/rejected": -2.709995746612549,
"logps/chosen": -247.4280242919922,
"logps/rejected": -207.9947052001953,
"loss": 0.6922,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.009775625541806221,
"rewards/margins": -0.0002165736659662798,
"rewards/rejected": 0.009992199949920177,
"step": 2710
},
{
"epoch": 0.48,
"learning_rate": 8.705289672544081e-08,
"logits/chosen": -2.8027420043945312,
"logits/rejected": -2.8436694145202637,
"logps/chosen": -202.6864471435547,
"logps/rejected": -221.2021026611328,
"loss": 0.6925,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.007427896372973919,
"rewards/margins": -0.0015940333250910044,
"rewards/rejected": 0.009021928533911705,
"step": 2720
},
{
"epoch": 0.48,
"learning_rate": 8.700251889168765e-08,
"logits/chosen": -2.680032253265381,
"logits/rejected": -2.7500858306884766,
"logps/chosen": -225.693359375,
"logps/rejected": -206.8023223876953,
"loss": 0.6926,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.00921904668211937,
"rewards/margins": 0.0021597917657345533,
"rewards/rejected": 0.007059253752231598,
"step": 2730
},
{
"epoch": 0.48,
"learning_rate": 8.69521410579345e-08,
"logits/chosen": -2.7341065406799316,
"logits/rejected": -2.755167245864868,
"logps/chosen": -193.05245971679688,
"logps/rejected": -170.5665740966797,
"loss": 0.6923,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.005958110094070435,
"rewards/margins": 0.0001765273918863386,
"rewards/rejected": 0.005781582556664944,
"step": 2740
},
{
"epoch": 0.48,
"learning_rate": 8.690176322418136e-08,
"logits/chosen": -2.7305095195770264,
"logits/rejected": -2.7078235149383545,
"logps/chosen": -233.4241485595703,
"logps/rejected": -181.7233123779297,
"loss": 0.6922,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.010703453794121742,
"rewards/margins": 0.002297390252351761,
"rewards/rejected": 0.008406064473092556,
"step": 2750
},
{
"epoch": 0.48,
"learning_rate": 8.685138539042821e-08,
"logits/chosen": -2.761038303375244,
"logits/rejected": -2.6922402381896973,
"logps/chosen": -191.82229614257812,
"logps/rejected": -203.77139282226562,
"loss": 0.6924,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.008268560282886028,
"rewards/margins": 6.912881508469582e-05,
"rewards/rejected": 0.00819943193346262,
"step": 2760
},
{
"epoch": 0.49,
"learning_rate": 8.680100755667505e-08,
"logits/chosen": -2.7586519718170166,
"logits/rejected": -2.695542097091675,
"logps/chosen": -230.31625366210938,
"logps/rejected": -218.05117797851562,
"loss": 0.6927,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.00877605751156807,
"rewards/margins": 0.0006737986695952713,
"rewards/rejected": 0.008102258667349815,
"step": 2770
},
{
"epoch": 0.49,
"learning_rate": 8.67506297229219e-08,
"logits/chosen": -2.7693123817443848,
"logits/rejected": -2.8033013343811035,
"logps/chosen": -268.99603271484375,
"logps/rejected": -246.95742797851562,
"loss": 0.6915,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.015248882584273815,
"rewards/margins": 0.0025188270956277847,
"rewards/rejected": 0.012730054557323456,
"step": 2780
},
{
"epoch": 0.49,
"learning_rate": 8.670025188916876e-08,
"logits/chosen": -2.764688014984131,
"logits/rejected": -2.758216619491577,
"logps/chosen": -206.0214080810547,
"logps/rejected": -178.74722290039062,
"loss": 0.6922,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.01020827703177929,
"rewards/margins": 0.0022834674455225468,
"rewards/rejected": 0.00792481005191803,
"step": 2790
},
{
"epoch": 0.49,
"learning_rate": 8.664987405541561e-08,
"logits/chosen": -2.723081350326538,
"logits/rejected": -2.7940492630004883,
"logps/chosen": -203.63230895996094,
"logps/rejected": -179.57211303710938,
"loss": 0.6918,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.00934748724102974,
"rewards/margins": 0.0031101994682103395,
"rewards/rejected": 0.0062372866086661816,
"step": 2800
},
{
"epoch": 0.49,
"learning_rate": 8.659949622166247e-08,
"logits/chosen": -2.743274211883545,
"logits/rejected": -2.7649941444396973,
"logps/chosen": -209.7469024658203,
"logps/rejected": -220.0643768310547,
"loss": 0.6921,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.008425967767834663,
"rewards/margins": 0.0009932437678799033,
"rewards/rejected": 0.007432723883539438,
"step": 2810
},
{
"epoch": 0.49,
"learning_rate": 8.654911838790932e-08,
"logits/chosen": -2.7621662616729736,
"logits/rejected": -2.7177906036376953,
"logps/chosen": -215.0526580810547,
"logps/rejected": -190.55581665039062,
"loss": 0.6922,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.010186800733208656,
"rewards/margins": 0.0018928442150354385,
"rewards/rejected": 0.008293956518173218,
"step": 2820
},
{
"epoch": 0.5,
"learning_rate": 8.649874055415617e-08,
"logits/chosen": -2.8004374504089355,
"logits/rejected": -2.7490596771240234,
"logps/chosen": -252.2415008544922,
"logps/rejected": -221.1431427001953,
"loss": 0.6919,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.012386414222419262,
"rewards/margins": 0.0008427410502918065,
"rewards/rejected": 0.01154367346316576,
"step": 2830
},
{
"epoch": 0.5,
"learning_rate": 8.644836272040303e-08,
"logits/chosen": -2.810251235961914,
"logits/rejected": -2.7899842262268066,
"logps/chosen": -239.23046875,
"logps/rejected": -231.6127471923828,
"loss": 0.6926,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.012533411383628845,
"rewards/margins": 0.0014264009660109878,
"rewards/rejected": 0.011107010766863823,
"step": 2840
},
{
"epoch": 0.5,
"learning_rate": 8.639798488664987e-08,
"logits/chosen": -2.784536600112915,
"logits/rejected": -2.7550041675567627,
"logps/chosen": -248.12338256835938,
"logps/rejected": -197.28073120117188,
"loss": 0.6915,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.014371541328728199,
"rewards/margins": 0.003601966891437769,
"rewards/rejected": 0.010769573971629143,
"step": 2850
},
{
"epoch": 0.5,
"learning_rate": 8.634760705289672e-08,
"logits/chosen": -2.8218891620635986,
"logits/rejected": -2.742927074432373,
"logps/chosen": -196.79637145996094,
"logps/rejected": -190.49765014648438,
"loss": 0.6923,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.00799397099763155,
"rewards/margins": -0.001486542634665966,
"rewards/rejected": 0.009480513632297516,
"step": 2860
},
{
"epoch": 0.5,
"learning_rate": 8.629722921914358e-08,
"logits/chosen": -2.766782522201538,
"logits/rejected": -2.7526514530181885,
"logps/chosen": -237.14126586914062,
"logps/rejected": -223.09487915039062,
"loss": 0.6926,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.010379480198025703,
"rewards/margins": 0.003819843288511038,
"rewards/rejected": 0.006559636443853378,
"step": 2870
},
{
"epoch": 0.5,
"learning_rate": 8.624685138539043e-08,
"logits/chosen": -2.694092273712158,
"logits/rejected": -2.7033393383026123,
"logps/chosen": -186.11802673339844,
"logps/rejected": -168.0809326171875,
"loss": 0.6917,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.010750077664852142,
"rewards/margins": 0.00394693948328495,
"rewards/rejected": 0.006803138647228479,
"step": 2880
},
{
"epoch": 0.51,
"learning_rate": 8.619647355163727e-08,
"logits/chosen": -2.7816433906555176,
"logits/rejected": -2.6702535152435303,
"logps/chosen": -207.6709747314453,
"logps/rejected": -180.0514678955078,
"loss": 0.6912,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.011553024873137474,
"rewards/margins": 0.00432405062019825,
"rewards/rejected": 0.007228974252939224,
"step": 2890
},
{
"epoch": 0.51,
"learning_rate": 8.614609571788412e-08,
"logits/chosen": -2.7347779273986816,
"logits/rejected": -2.7691762447357178,
"logps/chosen": -230.37808227539062,
"logps/rejected": -183.2679901123047,
"loss": 0.6913,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.009555203840136528,
"rewards/margins": 0.005391639657318592,
"rewards/rejected": 0.004163564182817936,
"step": 2900
},
{
"epoch": 0.51,
"learning_rate": 8.609571788413098e-08,
"logits/chosen": -2.8352231979370117,
"logits/rejected": -2.7687888145446777,
"logps/chosen": -208.2872772216797,
"logps/rejected": -177.54238891601562,
"loss": 0.6922,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.007140007801353931,
"rewards/margins": 0.00021615605510305613,
"rewards/rejected": 0.006923851557075977,
"step": 2910
},
{
"epoch": 0.51,
"learning_rate": 8.604534005037783e-08,
"logits/chosen": -2.801035165786743,
"logits/rejected": -2.7708606719970703,
"logps/chosen": -267.33074951171875,
"logps/rejected": -247.96484375,
"loss": 0.6919,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.012757198885083199,
"rewards/margins": 0.003161564003676176,
"rewards/rejected": 0.00959563534706831,
"step": 2920
},
{
"epoch": 0.51,
"learning_rate": 8.599496221662468e-08,
"logits/chosen": -2.798997163772583,
"logits/rejected": -2.7465548515319824,
"logps/chosen": -221.67544555664062,
"logps/rejected": -173.8419952392578,
"loss": 0.6921,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0111413998529315,
"rewards/margins": 0.0030490579083561897,
"rewards/rejected": 0.008092342875897884,
"step": 2930
},
{
"epoch": 0.51,
"learning_rate": 8.594458438287154e-08,
"logits/chosen": -2.745358943939209,
"logits/rejected": -2.7377078533172607,
"logps/chosen": -241.1657257080078,
"logps/rejected": -220.897705078125,
"loss": 0.6917,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.007529490627348423,
"rewards/margins": -6.388258043443784e-05,
"rewards/rejected": 0.00759337330237031,
"step": 2940
},
{
"epoch": 0.52,
"learning_rate": 8.589420654911839e-08,
"logits/chosen": -2.70111346244812,
"logits/rejected": -2.75768780708313,
"logps/chosen": -242.2528076171875,
"logps/rejected": -191.04638671875,
"loss": 0.6916,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.013275270350277424,
"rewards/margins": 0.005159012973308563,
"rewards/rejected": 0.00811625737696886,
"step": 2950
},
{
"epoch": 0.52,
"learning_rate": 8.584382871536524e-08,
"logits/chosen": -2.7602486610412598,
"logits/rejected": -2.752366065979004,
"logps/chosen": -266.2757263183594,
"logps/rejected": -203.05038452148438,
"loss": 0.6925,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.01176394708454609,
"rewards/margins": 0.002135035116225481,
"rewards/rejected": 0.009628912433981895,
"step": 2960
},
{
"epoch": 0.52,
"learning_rate": 8.579345088161209e-08,
"logits/chosen": -2.7365550994873047,
"logits/rejected": -2.801192045211792,
"logps/chosen": -237.6589813232422,
"logps/rejected": -185.87973022460938,
"loss": 0.6913,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.013516830280423164,
"rewards/margins": 0.0016924828523769975,
"rewards/rejected": 0.01182434894144535,
"step": 2970
},
{
"epoch": 0.52,
"learning_rate": 8.574307304785894e-08,
"logits/chosen": -2.7330987453460693,
"logits/rejected": -2.7530648708343506,
"logps/chosen": -234.9535675048828,
"logps/rejected": -240.99813842773438,
"loss": 0.6917,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.015216231346130371,
"rewards/margins": 0.004241775255650282,
"rewards/rejected": 0.010974457487463951,
"step": 2980
},
{
"epoch": 0.52,
"learning_rate": 8.569269521410579e-08,
"logits/chosen": -2.765040397644043,
"logits/rejected": -2.7268776893615723,
"logps/chosen": -204.8981475830078,
"logps/rejected": -212.19705200195312,
"loss": 0.6916,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.013496240600943565,
"rewards/margins": 0.0013568944996222854,
"rewards/rejected": 0.012139346450567245,
"step": 2990
},
{
"epoch": 0.53,
"learning_rate": 8.564231738035263e-08,
"logits/chosen": -2.8201658725738525,
"logits/rejected": -2.7453672885894775,
"logps/chosen": -232.99221801757812,
"logps/rejected": -246.0234832763672,
"loss": 0.6916,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.014087246730923653,
"rewards/margins": 0.0024903384037315845,
"rewards/rejected": 0.01159690786153078,
"step": 3000
},
{
"epoch": 0.53,
"learning_rate": 8.559193954659949e-08,
"logits/chosen": -2.8084664344787598,
"logits/rejected": -2.7652931213378906,
"logps/chosen": -276.5728454589844,
"logps/rejected": -220.3472900390625,
"loss": 0.6917,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.012886193580925465,
"rewards/margins": 0.0032176401000469923,
"rewards/rejected": 0.009668553248047829,
"step": 3010
},
{
"epoch": 0.53,
"learning_rate": 8.554156171284634e-08,
"logits/chosen": -2.7719342708587646,
"logits/rejected": -2.784611701965332,
"logps/chosen": -238.6121826171875,
"logps/rejected": -219.5137939453125,
"loss": 0.692,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.010869468562304974,
"rewards/margins": 0.0018772600451484323,
"rewards/rejected": 0.00899220909923315,
"step": 3020
},
{
"epoch": 0.53,
"learning_rate": 8.54911838790932e-08,
"logits/chosen": -2.8003268241882324,
"logits/rejected": -2.795473098754883,
"logps/chosen": -229.3064422607422,
"logps/rejected": -202.93734741210938,
"loss": 0.6921,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.011820869520306587,
"rewards/margins": 0.003250813577324152,
"rewards/rejected": 0.008570056408643723,
"step": 3030
},
{
"epoch": 0.53,
"learning_rate": 8.544080604534005e-08,
"logits/chosen": -2.7847442626953125,
"logits/rejected": -2.734316349029541,
"logps/chosen": -201.69662475585938,
"logps/rejected": -186.3741455078125,
"loss": 0.6918,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.010374282486736774,
"rewards/margins": 0.0019776958506554365,
"rewards/rejected": 0.008396586403250694,
"step": 3040
},
{
"epoch": 0.53,
"learning_rate": 8.53904282115869e-08,
"logits/chosen": -2.7927279472351074,
"logits/rejected": -2.799988269805908,
"logps/chosen": -238.63778686523438,
"logps/rejected": -213.6460723876953,
"loss": 0.692,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.015687134116888046,
"rewards/margins": 0.0027517948765307665,
"rewards/rejected": 0.012935337610542774,
"step": 3050
},
{
"epoch": 0.54,
"learning_rate": 8.534005037783375e-08,
"logits/chosen": -2.6211276054382324,
"logits/rejected": -2.582188606262207,
"logps/chosen": -215.00106811523438,
"logps/rejected": -182.13609313964844,
"loss": 0.6923,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.011294371448457241,
"rewards/margins": 0.001207565190270543,
"rewards/rejected": 0.010086806491017342,
"step": 3060
},
{
"epoch": 0.54,
"learning_rate": 8.528967254408061e-08,
"logits/chosen": -2.757004737854004,
"logits/rejected": -2.819514036178589,
"logps/chosen": -221.3273162841797,
"logps/rejected": -190.31556701660156,
"loss": 0.6921,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.011431792750954628,
"rewards/margins": 0.001231744303368032,
"rewards/rejected": 0.010200048796832561,
"step": 3070
},
{
"epoch": 0.54,
"learning_rate": 8.523929471032745e-08,
"logits/chosen": -2.7367422580718994,
"logits/rejected": -2.7337427139282227,
"logps/chosen": -263.4180603027344,
"logps/rejected": -230.3423309326172,
"loss": 0.6916,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.015658225864171982,
"rewards/margins": 0.0033743069507181644,
"rewards/rejected": 0.012283921241760254,
"step": 3080
},
{
"epoch": 0.54,
"learning_rate": 8.51889168765743e-08,
"logits/chosen": -2.800112247467041,
"logits/rejected": -2.7367866039276123,
"logps/chosen": -218.00650024414062,
"logps/rejected": -169.1083526611328,
"loss": 0.6923,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.012381301261484623,
"rewards/margins": 0.005484296940267086,
"rewards/rejected": 0.006897004786878824,
"step": 3090
},
{
"epoch": 0.54,
"learning_rate": 8.513853904282116e-08,
"logits/chosen": -2.7532482147216797,
"logits/rejected": -2.7856948375701904,
"logps/chosen": -257.03302001953125,
"logps/rejected": -208.6194305419922,
"loss": 0.6925,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.014161042869091034,
"rewards/margins": 0.002776671200990677,
"rewards/rejected": 0.011384371668100357,
"step": 3100
},
{
"epoch": 0.54,
"learning_rate": 8.508816120906801e-08,
"logits/chosen": -2.7750141620635986,
"logits/rejected": -2.7644925117492676,
"logps/chosen": -237.3404541015625,
"logps/rejected": -179.40928649902344,
"loss": 0.692,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.010464548133313656,
"rewards/margins": -0.0005554911913350224,
"rewards/rejected": 0.011020039208233356,
"step": 3110
},
{
"epoch": 0.55,
"learning_rate": 8.503778337531485e-08,
"logits/chosen": -2.740729808807373,
"logits/rejected": -2.842524766921997,
"logps/chosen": -237.0664520263672,
"logps/rejected": -211.84603881835938,
"loss": 0.6909,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.011694247834384441,
"rewards/margins": -0.0019409225787967443,
"rewards/rejected": 0.01363517064601183,
"step": 3120
},
{
"epoch": 0.55,
"learning_rate": 8.49874055415617e-08,
"logits/chosen": -2.7111763954162598,
"logits/rejected": -2.7561068534851074,
"logps/chosen": -263.2214660644531,
"logps/rejected": -206.15432739257812,
"loss": 0.6909,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.013094994239509106,
"rewards/margins": 0.0035277139395475388,
"rewards/rejected": 0.009567281231284142,
"step": 3130
},
{
"epoch": 0.55,
"learning_rate": 8.493702770780856e-08,
"logits/chosen": -2.720445394515991,
"logits/rejected": -2.7390005588531494,
"logps/chosen": -226.5557098388672,
"logps/rejected": -216.19784545898438,
"loss": 0.6922,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.012567183002829552,
"rewards/margins": 0.0029570916667580605,
"rewards/rejected": 0.009610090404748917,
"step": 3140
},
{
"epoch": 0.55,
"learning_rate": 8.488664987405541e-08,
"logits/chosen": -2.736865758895874,
"logits/rejected": -2.7989611625671387,
"logps/chosen": -270.09747314453125,
"logps/rejected": -230.9444122314453,
"loss": 0.6917,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.014618085697293282,
"rewards/margins": 0.003351908642798662,
"rewards/rejected": 0.011266176588833332,
"step": 3150
},
{
"epoch": 0.55,
"learning_rate": 8.483627204030226e-08,
"logits/chosen": -2.685662031173706,
"logits/rejected": -2.750356912612915,
"logps/chosen": -271.740234375,
"logps/rejected": -247.66781616210938,
"loss": 0.6918,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.01378130353987217,
"rewards/margins": 0.0003704793634824455,
"rewards/rejected": 0.013410824351012707,
"step": 3160
},
{
"epoch": 0.56,
"learning_rate": 8.478589420654912e-08,
"logits/chosen": -2.7123258113861084,
"logits/rejected": -2.8179118633270264,
"logps/chosen": -233.6159210205078,
"logps/rejected": -223.5303955078125,
"loss": 0.6915,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.014396825805306435,
"rewards/margins": 0.003176445607095957,
"rewards/rejected": 0.01122037973254919,
"step": 3170
},
{
"epoch": 0.56,
"learning_rate": 8.473551637279597e-08,
"logits/chosen": -2.7784855365753174,
"logits/rejected": -2.7305197715759277,
"logps/chosen": -258.8409118652344,
"logps/rejected": -214.46981811523438,
"loss": 0.6914,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.01418989896774292,
"rewards/margins": 0.0008127937326207757,
"rewards/rejected": 0.013377104885876179,
"step": 3180
},
{
"epoch": 0.56,
"learning_rate": 8.468513853904283e-08,
"logits/chosen": -2.7307345867156982,
"logits/rejected": -2.750396251678467,
"logps/chosen": -214.94189453125,
"logps/rejected": -179.4948272705078,
"loss": 0.6911,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.012370200827717781,
"rewards/margins": 0.0020483885891735554,
"rewards/rejected": 0.010321812704205513,
"step": 3190
},
{
"epoch": 0.56,
"learning_rate": 8.463476070528967e-08,
"logits/chosen": -2.716055154800415,
"logits/rejected": -2.805588722229004,
"logps/chosen": -236.4894256591797,
"logps/rejected": -175.95303344726562,
"loss": 0.6919,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.012703245505690575,
"rewards/margins": 0.0037045180797576904,
"rewards/rejected": 0.008998729288578033,
"step": 3200
},
{
"epoch": 0.56,
"learning_rate": 8.458438287153652e-08,
"logits/chosen": -2.7577478885650635,
"logits/rejected": -2.724205493927002,
"logps/chosen": -223.320556640625,
"logps/rejected": -222.6649932861328,
"loss": 0.6917,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.010703946463763714,
"rewards/margins": 0.0017586011672392488,
"rewards/rejected": 0.0089453449472785,
"step": 3210
},
{
"epoch": 0.56,
"learning_rate": 8.453400503778337e-08,
"logits/chosen": -2.7715744972229004,
"logits/rejected": -2.7677001953125,
"logps/chosen": -298.09503173828125,
"logps/rejected": -261.20379638671875,
"loss": 0.692,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.01782422699034214,
"rewards/margins": 0.004209473729133606,
"rewards/rejected": 0.013614753261208534,
"step": 3220
},
{
"epoch": 0.57,
"learning_rate": 8.448362720403023e-08,
"logits/chosen": -2.7621097564697266,
"logits/rejected": -2.7440028190612793,
"logps/chosen": -214.5993194580078,
"logps/rejected": -223.1764678955078,
"loss": 0.6918,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.011158348992466927,
"rewards/margins": 0.004007419571280479,
"rewards/rejected": 0.007150929421186447,
"step": 3230
},
{
"epoch": 0.57,
"learning_rate": 8.443324937027707e-08,
"logits/chosen": -2.788442611694336,
"logits/rejected": -2.7765183448791504,
"logps/chosen": -225.32937622070312,
"logps/rejected": -209.044677734375,
"loss": 0.6916,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.014530852437019348,
"rewards/margins": 0.00227823993191123,
"rewards/rejected": 0.01225261203944683,
"step": 3240
},
{
"epoch": 0.57,
"learning_rate": 8.438287153652392e-08,
"logits/chosen": -2.7100307941436768,
"logits/rejected": -2.7646098136901855,
"logps/chosen": -236.94656372070312,
"logps/rejected": -199.8778533935547,
"loss": 0.6908,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.01314136665314436,
"rewards/margins": 0.004657679237425327,
"rewards/rejected": 0.008483686484396458,
"step": 3250
},
{
"epoch": 0.57,
"learning_rate": 8.433249370277077e-08,
"logits/chosen": -2.819563865661621,
"logits/rejected": -2.7609450817108154,
"logps/chosen": -253.8069305419922,
"logps/rejected": -241.51123046875,
"loss": 0.6923,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.012674269266426563,
"rewards/margins": 0.0009184217196889222,
"rewards/rejected": 0.011755848303437233,
"step": 3260
},
{
"epoch": 0.57,
"learning_rate": 8.428211586901763e-08,
"logits/chosen": -2.685859203338623,
"logits/rejected": -2.7351815700531006,
"logps/chosen": -227.080810546875,
"logps/rejected": -203.94802856445312,
"loss": 0.6917,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.014903845265507698,
"rewards/margins": 0.0018497860291972756,
"rewards/rejected": 0.013054059818387032,
"step": 3270
},
{
"epoch": 0.57,
"learning_rate": 8.423173803526448e-08,
"logits/chosen": -2.7697246074676514,
"logits/rejected": -2.8137755393981934,
"logps/chosen": -251.1637725830078,
"logps/rejected": -195.75613403320312,
"loss": 0.6918,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.012458008714020252,
"rewards/margins": 0.004305009264498949,
"rewards/rejected": 0.008152998983860016,
"step": 3280
},
{
"epoch": 0.58,
"learning_rate": 8.418136020151134e-08,
"logits/chosen": -2.773317813873291,
"logits/rejected": -2.779855489730835,
"logps/chosen": -223.1930389404297,
"logps/rejected": -198.455322265625,
"loss": 0.6925,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.011802679859101772,
"rewards/margins": 0.0005634138360619545,
"rewards/rejected": 0.011239266023039818,
"step": 3290
},
{
"epoch": 0.58,
"learning_rate": 8.413098236775819e-08,
"logits/chosen": -2.7221474647521973,
"logits/rejected": -2.702664375305176,
"logps/chosen": -274.08392333984375,
"logps/rejected": -247.7399444580078,
"loss": 0.6915,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.019806358963251114,
"rewards/margins": 0.0065388367511332035,
"rewards/rejected": 0.013267521746456623,
"step": 3300
},
{
"epoch": 0.58,
"learning_rate": 8.408060453400503e-08,
"logits/chosen": -2.8209447860717773,
"logits/rejected": -2.834242582321167,
"logps/chosen": -247.25802612304688,
"logps/rejected": -201.07403564453125,
"loss": 0.692,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.016469743102788925,
"rewards/margins": 0.004864540882408619,
"rewards/rejected": 0.011605201289057732,
"step": 3310
},
{
"epoch": 0.58,
"learning_rate": 8.403022670025188e-08,
"logits/chosen": -2.7461419105529785,
"logits/rejected": -2.732264280319214,
"logps/chosen": -227.6762237548828,
"logps/rejected": -209.2851104736328,
"loss": 0.691,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.012286007404327393,
"rewards/margins": 0.0037416242994368076,
"rewards/rejected": 0.008544383570551872,
"step": 3320
},
{
"epoch": 0.58,
"learning_rate": 8.397984886649874e-08,
"logits/chosen": -2.713840961456299,
"logits/rejected": -2.692565441131592,
"logps/chosen": -228.81851196289062,
"logps/rejected": -199.67190551757812,
"loss": 0.6916,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.017076753079891205,
"rewards/margins": 0.006653298623859882,
"rewards/rejected": 0.010423455387353897,
"step": 3330
},
{
"epoch": 0.59,
"learning_rate": 8.392947103274559e-08,
"logits/chosen": -2.811196804046631,
"logits/rejected": -2.7759921550750732,
"logps/chosen": -237.18215942382812,
"logps/rejected": -184.60023498535156,
"loss": 0.6912,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.015599017962813377,
"rewards/margins": 0.004597905091941357,
"rewards/rejected": 0.011001111008226871,
"step": 3340
},
{
"epoch": 0.59,
"learning_rate": 8.387909319899243e-08,
"logits/chosen": -2.712432861328125,
"logits/rejected": -2.8248891830444336,
"logps/chosen": -284.87091064453125,
"logps/rejected": -221.70162963867188,
"loss": 0.6911,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.015140047296881676,
"rewards/margins": -0.00015327543951570988,
"rewards/rejected": 0.015293324366211891,
"step": 3350
},
{
"epoch": 0.59,
"learning_rate": 8.382871536523928e-08,
"logits/chosen": -2.778764009475708,
"logits/rejected": -2.8072402477264404,
"logps/chosen": -249.6968536376953,
"logps/rejected": -218.6016082763672,
"loss": 0.6911,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.01566213183104992,
"rewards/margins": 0.0012918005231767893,
"rewards/rejected": 0.014370331540703773,
"step": 3360
},
{
"epoch": 0.59,
"learning_rate": 8.377833753148614e-08,
"logits/chosen": -2.770099639892578,
"logits/rejected": -2.793405771255493,
"logps/chosen": -242.748291015625,
"logps/rejected": -207.92636108398438,
"loss": 0.6917,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0115726999938488,
"rewards/margins": 0.004362519830465317,
"rewards/rejected": 0.0072101810947060585,
"step": 3370
},
{
"epoch": 0.59,
"learning_rate": 8.372795969773299e-08,
"logits/chosen": -2.7587761878967285,
"logits/rejected": -2.8187568187713623,
"logps/chosen": -288.847412109375,
"logps/rejected": -241.4041290283203,
"loss": 0.6924,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.019069483503699303,
"rewards/margins": 0.003561516525223851,
"rewards/rejected": 0.01550796814262867,
"step": 3380
},
{
"epoch": 0.59,
"learning_rate": 8.367758186397985e-08,
"logits/chosen": -2.773113489151001,
"logits/rejected": -2.843980312347412,
"logps/chosen": -235.67578125,
"logps/rejected": -217.6513214111328,
"loss": 0.6924,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.011275621131062508,
"rewards/margins": -0.0001427721290383488,
"rewards/rejected": 0.01141839288175106,
"step": 3390
},
{
"epoch": 0.6,
"learning_rate": 8.36272040302267e-08,
"logits/chosen": -2.858863115310669,
"logits/rejected": -2.758176326751709,
"logps/chosen": -248.9114227294922,
"logps/rejected": -233.37063598632812,
"loss": 0.6912,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.019003715366125107,
"rewards/margins": 0.0045727817341685295,
"rewards/rejected": 0.014430937357246876,
"step": 3400
},
{
"epoch": 0.6,
"learning_rate": 8.357682619647355e-08,
"logits/chosen": -2.7978243827819824,
"logits/rejected": -2.765048027038574,
"logps/chosen": -215.2990264892578,
"logps/rejected": -195.3312225341797,
"loss": 0.692,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.012433426454663277,
"rewards/margins": 0.0025961692444980145,
"rewards/rejected": 0.009837256744503975,
"step": 3410
},
{
"epoch": 0.6,
"learning_rate": 8.35264483627204e-08,
"logits/chosen": -2.8078112602233887,
"logits/rejected": -2.7712979316711426,
"logps/chosen": -225.05715942382812,
"logps/rejected": -191.1551971435547,
"loss": 0.6917,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.011315623298287392,
"rewards/margins": 0.004302586428821087,
"rewards/rejected": 0.007013037800788879,
"step": 3420
},
{
"epoch": 0.6,
"learning_rate": 8.347607052896725e-08,
"logits/chosen": -2.701322078704834,
"logits/rejected": -2.6965625286102295,
"logps/chosen": -190.59228515625,
"logps/rejected": -183.9395294189453,
"loss": 0.6921,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.013294106349349022,
"rewards/margins": 0.0023096068762242794,
"rewards/rejected": 0.01098449993878603,
"step": 3430
},
{
"epoch": 0.6,
"learning_rate": 8.34256926952141e-08,
"logits/chosen": -2.743400812149048,
"logits/rejected": -2.7452921867370605,
"logps/chosen": -258.9476318359375,
"logps/rejected": -218.33700561523438,
"loss": 0.6913,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.014264727011322975,
"rewards/margins": 0.0023330049589276314,
"rewards/rejected": 0.011931722052395344,
"step": 3440
},
{
"epoch": 0.6,
"learning_rate": 8.337531486146095e-08,
"logits/chosen": -2.759187698364258,
"logits/rejected": -2.7136118412017822,
"logps/chosen": -221.3391876220703,
"logps/rejected": -180.05746459960938,
"loss": 0.692,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.013907767832279205,
"rewards/margins": 0.004912000615149736,
"rewards/rejected": 0.008995766751468182,
"step": 3450
},
{
"epoch": 0.61,
"learning_rate": 8.332493702770781e-08,
"logits/chosen": -2.671977996826172,
"logits/rejected": -2.743464946746826,
"logps/chosen": -240.4029083251953,
"logps/rejected": -222.5838623046875,
"loss": 0.6921,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.011776207946240902,
"rewards/margins": 0.0016693586949259043,
"rewards/rejected": 0.010106848552823067,
"step": 3460
},
{
"epoch": 0.61,
"learning_rate": 8.327455919395465e-08,
"logits/chosen": -2.760468006134033,
"logits/rejected": -2.7636971473693848,
"logps/chosen": -210.5015106201172,
"logps/rejected": -191.4309539794922,
"loss": 0.6913,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.012788991443812847,
"rewards/margins": 0.0014230671804398298,
"rewards/rejected": 0.011365924030542374,
"step": 3470
},
{
"epoch": 0.61,
"learning_rate": 8.32241813602015e-08,
"logits/chosen": -2.7345573902130127,
"logits/rejected": -2.7453200817108154,
"logps/chosen": -260.7548828125,
"logps/rejected": -212.4744110107422,
"loss": 0.6919,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.016130229458212852,
"rewards/margins": 0.0023641791194677353,
"rewards/rejected": 0.013766050338745117,
"step": 3480
},
{
"epoch": 0.61,
"learning_rate": 8.317380352644836e-08,
"logits/chosen": -2.7350945472717285,
"logits/rejected": -2.7537972927093506,
"logps/chosen": -261.77496337890625,
"logps/rejected": -223.4450225830078,
"loss": 0.6917,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.016082722693681717,
"rewards/margins": 0.0003509976086206734,
"rewards/rejected": 0.015731725841760635,
"step": 3490
},
{
"epoch": 0.61,
"learning_rate": 8.312342569269521e-08,
"logits/chosen": -2.717952013015747,
"logits/rejected": -2.6623072624206543,
"logps/chosen": -249.53726196289062,
"logps/rejected": -235.1985321044922,
"loss": 0.692,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.016532665118575096,
"rewards/margins": 0.003554257797077298,
"rewards/rejected": 0.012978407554328442,
"step": 3500
},
{
"epoch": 0.61,
"learning_rate": 8.307304785894206e-08,
"logits/chosen": -2.788193702697754,
"logits/rejected": -2.796319007873535,
"logps/chosen": -226.8190155029297,
"logps/rejected": -194.38963317871094,
"loss": 0.6909,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.016295744106173515,
"rewards/margins": 0.00471791485324502,
"rewards/rejected": 0.011577830649912357,
"step": 3510
},
{
"epoch": 0.62,
"learning_rate": 8.302267002518892e-08,
"logits/chosen": -2.719542980194092,
"logits/rejected": -2.699769973754883,
"logps/chosen": -219.9004669189453,
"logps/rejected": -181.20230102539062,
"loss": 0.6921,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.010805217549204826,
"rewards/margins": 0.002578904153779149,
"rewards/rejected": 0.008226314559578896,
"step": 3520
},
{
"epoch": 0.62,
"learning_rate": 8.297229219143577e-08,
"logits/chosen": -2.7711305618286133,
"logits/rejected": -2.761723756790161,
"logps/chosen": -265.3699951171875,
"logps/rejected": -235.4482421875,
"loss": 0.6915,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.015871699899435043,
"rewards/margins": 0.0017049426678568125,
"rewards/rejected": 0.014166759327054024,
"step": 3530
},
{
"epoch": 0.62,
"learning_rate": 8.292191435768262e-08,
"logits/chosen": -2.7074053287506104,
"logits/rejected": -2.709003210067749,
"logps/chosen": -230.49472045898438,
"logps/rejected": -194.09027099609375,
"loss": 0.691,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.01634136773645878,
"rewards/margins": 0.006125512532889843,
"rewards/rejected": 0.01021585427224636,
"step": 3540
},
{
"epoch": 0.62,
"learning_rate": 8.287153652392946e-08,
"logits/chosen": -2.709663152694702,
"logits/rejected": -2.7229886054992676,
"logps/chosen": -214.0351104736328,
"logps/rejected": -223.4528350830078,
"loss": 0.6913,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": 0.01229914091527462,
"rewards/margins": -0.001658583409152925,
"rewards/rejected": 0.013957725837826729,
"step": 3550
},
{
"epoch": 0.62,
"learning_rate": 8.282115869017632e-08,
"logits/chosen": -2.6734941005706787,
"logits/rejected": -2.6738343238830566,
"logps/chosen": -186.98057556152344,
"logps/rejected": -172.816650390625,
"loss": 0.6913,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.00906095840036869,
"rewards/margins": 0.0004602237604558468,
"rewards/rejected": 0.008600736036896706,
"step": 3560
},
{
"epoch": 0.63,
"learning_rate": 8.277078085642317e-08,
"logits/chosen": -2.7180447578430176,
"logits/rejected": -2.687653064727783,
"logps/chosen": -180.7360382080078,
"logps/rejected": -178.57864379882812,
"loss": 0.6921,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.007827245630323887,
"rewards/margins": -0.0009862823644652963,
"rewards/rejected": 0.008813528344035149,
"step": 3570
},
{
"epoch": 0.63,
"learning_rate": 8.272040302267002e-08,
"logits/chosen": -2.7027173042297363,
"logits/rejected": -2.6870369911193848,
"logps/chosen": -208.6110382080078,
"logps/rejected": -167.7442626953125,
"loss": 0.692,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.01145018357783556,
"rewards/margins": 0.0035087857395410538,
"rewards/rejected": 0.007941396906971931,
"step": 3580
},
{
"epoch": 0.63,
"learning_rate": 8.267002518891686e-08,
"logits/chosen": -2.7568917274475098,
"logits/rejected": -2.6639156341552734,
"logps/chosen": -226.4164276123047,
"logps/rejected": -186.1335906982422,
"loss": 0.6917,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.013830587267875671,
"rewards/margins": 0.0034837317653000355,
"rewards/rejected": 0.010346856899559498,
"step": 3590
},
{
"epoch": 0.63,
"learning_rate": 8.261964735516372e-08,
"logits/chosen": -2.8411202430725098,
"logits/rejected": -2.8351664543151855,
"logps/chosen": -207.5603790283203,
"logps/rejected": -206.82534790039062,
"loss": 0.6918,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.012709485366940498,
"rewards/margins": -0.0002613008546177298,
"rewards/rejected": 0.012970787473022938,
"step": 3600
},
{
"epoch": 0.63,
"learning_rate": 8.256926952141057e-08,
"logits/chosen": -2.85115909576416,
"logits/rejected": -2.836247682571411,
"logps/chosen": -217.4815673828125,
"logps/rejected": -217.00668334960938,
"loss": 0.6919,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.015054309740662575,
"rewards/margins": 0.001863854588009417,
"rewards/rejected": 0.013190452940762043,
"step": 3610
},
{
"epoch": 0.63,
"learning_rate": 8.251889168765743e-08,
"logits/chosen": -2.74369740486145,
"logits/rejected": -2.7580039501190186,
"logps/chosen": -280.5350341796875,
"logps/rejected": -250.761962890625,
"loss": 0.692,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02001040428876877,
"rewards/margins": 0.003991215955466032,
"rewards/rejected": 0.01601918786764145,
"step": 3620
},
{
"epoch": 0.64,
"learning_rate": 8.246851385390428e-08,
"logits/chosen": -2.7671589851379395,
"logits/rejected": -2.7030556201934814,
"logps/chosen": -226.4773712158203,
"logps/rejected": -183.44740295410156,
"loss": 0.6919,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.014777980744838715,
"rewards/margins": 0.006304244510829449,
"rewards/rejected": 0.008473738096654415,
"step": 3630
},
{
"epoch": 0.64,
"learning_rate": 8.241813602015113e-08,
"logits/chosen": -2.7083332538604736,
"logits/rejected": -2.695016860961914,
"logps/chosen": -215.36013793945312,
"logps/rejected": -189.6326904296875,
"loss": 0.6912,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.013701984658837318,
"rewards/margins": 0.0003051554667763412,
"rewards/rejected": 0.01339682936668396,
"step": 3640
},
{
"epoch": 0.64,
"learning_rate": 8.236775818639799e-08,
"logits/chosen": -2.798619270324707,
"logits/rejected": -2.793792247772217,
"logps/chosen": -232.0058135986328,
"logps/rejected": -157.7205810546875,
"loss": 0.691,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.01850191317498684,
"rewards/margins": 0.0096164895221591,
"rewards/rejected": 0.008885422721505165,
"step": 3650
},
{
"epoch": 0.64,
"learning_rate": 8.231738035264483e-08,
"logits/chosen": -2.7713623046875,
"logits/rejected": -2.6689579486846924,
"logps/chosen": -201.49600219726562,
"logps/rejected": -234.8392333984375,
"loss": 0.692,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.012621419504284859,
"rewards/margins": -0.00029890690348111093,
"rewards/rejected": 0.012920325621962547,
"step": 3660
},
{
"epoch": 0.64,
"learning_rate": 8.226700251889168e-08,
"logits/chosen": -2.767369508743286,
"logits/rejected": -2.744903326034546,
"logps/chosen": -206.9405059814453,
"logps/rejected": -207.5795440673828,
"loss": 0.6919,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.011534372344613075,
"rewards/margins": -0.0018367780139669776,
"rewards/rejected": 0.013371150009334087,
"step": 3670
},
{
"epoch": 0.64,
"learning_rate": 8.221662468513853e-08,
"logits/chosen": -2.7466063499450684,
"logits/rejected": -2.765381097793579,
"logps/chosen": -222.0699462890625,
"logps/rejected": -205.1193084716797,
"loss": 0.6914,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.012425544671714306,
"rewards/margins": -0.00028726962045766413,
"rewards/rejected": 0.012712815776467323,
"step": 3680
},
{
"epoch": 0.65,
"learning_rate": 8.216624685138539e-08,
"logits/chosen": -2.7388596534729004,
"logits/rejected": -2.7755088806152344,
"logps/chosen": -275.1582336425781,
"logps/rejected": -225.3055419921875,
"loss": 0.6914,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": 0.025951793417334557,
"rewards/margins": 0.010948443785309792,
"rewards/rejected": 0.015003351494669914,
"step": 3690
},
{
"epoch": 0.65,
"learning_rate": 8.211586901763223e-08,
"logits/chosen": -2.7461769580841064,
"logits/rejected": -2.708989143371582,
"logps/chosen": -228.46145629882812,
"logps/rejected": -185.53692626953125,
"loss": 0.6913,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.017765622586011887,
"rewards/margins": 0.00780740100890398,
"rewards/rejected": 0.009958220645785332,
"step": 3700
},
{
"epoch": 0.65,
"learning_rate": 8.206549118387908e-08,
"logits/chosen": -2.733278751373291,
"logits/rejected": -2.7251486778259277,
"logps/chosen": -260.572509765625,
"logps/rejected": -225.13363647460938,
"loss": 0.6911,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.019569676369428635,
"rewards/margins": 0.005702861584722996,
"rewards/rejected": 0.013866816647350788,
"step": 3710
},
{
"epoch": 0.65,
"learning_rate": 8.201511335012594e-08,
"logits/chosen": -2.6957457065582275,
"logits/rejected": -2.7972590923309326,
"logps/chosen": -267.50677490234375,
"logps/rejected": -215.5604705810547,
"loss": 0.6915,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.020175551995635033,
"rewards/margins": 0.005252575036138296,
"rewards/rejected": 0.01492297649383545,
"step": 3720
},
{
"epoch": 0.65,
"learning_rate": 8.19647355163728e-08,
"logits/chosen": -2.713207960128784,
"logits/rejected": -2.72871994972229,
"logps/chosen": -233.4993896484375,
"logps/rejected": -204.14529418945312,
"loss": 0.6929,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.014108104631304741,
"rewards/margins": -0.003692076075822115,
"rewards/rejected": 0.01780017837882042,
"step": 3730
},
{
"epoch": 0.66,
"learning_rate": 8.191435768261964e-08,
"logits/chosen": -2.748497247695923,
"logits/rejected": -2.683332681655884,
"logps/chosen": -240.52297973632812,
"logps/rejected": -233.1362762451172,
"loss": 0.6911,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.016229938715696335,
"rewards/margins": 0.0006633886368945241,
"rewards/rejected": 0.015566547401249409,
"step": 3740
},
{
"epoch": 0.66,
"learning_rate": 8.18639798488665e-08,
"logits/chosen": -2.7239058017730713,
"logits/rejected": -2.740793228149414,
"logps/chosen": -247.53268432617188,
"logps/rejected": -272.5812683105469,
"loss": 0.6916,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0161224864423275,
"rewards/margins": 0.0009723890689201653,
"rewards/rejected": 0.015150099992752075,
"step": 3750
},
{
"epoch": 0.66,
"learning_rate": 8.181360201511335e-08,
"logits/chosen": -2.7831082344055176,
"logits/rejected": -2.815091609954834,
"logps/chosen": -233.9501495361328,
"logps/rejected": -208.8319854736328,
"loss": 0.6909,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.017066344618797302,
"rewards/margins": 0.0011864884290844202,
"rewards/rejected": 0.015879856422543526,
"step": 3760
},
{
"epoch": 0.66,
"learning_rate": 8.17632241813602e-08,
"logits/chosen": -2.7610182762145996,
"logits/rejected": -2.765444278717041,
"logps/chosen": -269.3284912109375,
"logps/rejected": -238.10537719726562,
"loss": 0.6912,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.019205298274755478,
"rewards/margins": 0.007051876280456781,
"rewards/rejected": 0.012153422459959984,
"step": 3770
},
{
"epoch": 0.66,
"learning_rate": 8.171284634760704e-08,
"logits/chosen": -2.7351415157318115,
"logits/rejected": -2.679765224456787,
"logps/chosen": -218.440673828125,
"logps/rejected": -192.87567138671875,
"loss": 0.6911,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.01345922239124775,
"rewards/margins": 0.004528115503489971,
"rewards/rejected": 0.008931105956435204,
"step": 3780
},
{
"epoch": 0.66,
"learning_rate": 8.16624685138539e-08,
"logits/chosen": -2.7771928310394287,
"logits/rejected": -2.687178134918213,
"logps/chosen": -257.64398193359375,
"logps/rejected": -194.52593994140625,
"loss": 0.691,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.01612105406820774,
"rewards/margins": 0.0037273832131177187,
"rewards/rejected": 0.012393670156598091,
"step": 3790
},
{
"epoch": 0.67,
"learning_rate": 8.161209068010075e-08,
"logits/chosen": -2.742800712585449,
"logits/rejected": -2.764816999435425,
"logps/chosen": -207.69876098632812,
"logps/rejected": -197.75302124023438,
"loss": 0.6926,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.015343104489147663,
"rewards/margins": 0.004005838185548782,
"rewards/rejected": 0.011337265372276306,
"step": 3800
},
{
"epoch": 0.67,
"learning_rate": 8.15617128463476e-08,
"logits/chosen": -2.7895233631134033,
"logits/rejected": -2.6712045669555664,
"logps/chosen": -276.7768249511719,
"logps/rejected": -248.6250457763672,
"loss": 0.6912,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.02004379592835903,
"rewards/margins": 0.006672368384897709,
"rewards/rejected": 0.013371428474783897,
"step": 3810
},
{
"epoch": 0.67,
"learning_rate": 8.151133501259445e-08,
"logits/chosen": -2.7735464572906494,
"logits/rejected": -2.731327533721924,
"logps/chosen": -252.3322296142578,
"logps/rejected": -193.44198608398438,
"loss": 0.6907,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.01836908422410488,
"rewards/margins": 0.005864441394805908,
"rewards/rejected": 0.012504642829298973,
"step": 3820
},
{
"epoch": 0.67,
"learning_rate": 8.14609571788413e-08,
"logits/chosen": -2.7429397106170654,
"logits/rejected": -2.7197344303131104,
"logps/chosen": -166.81492614746094,
"logps/rejected": -153.70217895507812,
"loss": 0.6909,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.00818006880581379,
"rewards/margins": 0.001661596237681806,
"rewards/rejected": 0.006518472917377949,
"step": 3830
},
{
"epoch": 0.67,
"learning_rate": 8.141057934508817e-08,
"logits/chosen": -2.663329839706421,
"logits/rejected": -2.762928009033203,
"logps/chosen": -230.36672973632812,
"logps/rejected": -208.890380859375,
"loss": 0.6908,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.019962593913078308,
"rewards/margins": 0.005378905683755875,
"rewards/rejected": 0.014583689160645008,
"step": 3840
},
{
"epoch": 0.67,
"learning_rate": 8.136020151133502e-08,
"logits/chosen": -2.7788891792297363,
"logits/rejected": -2.7233879566192627,
"logps/chosen": -222.71078491210938,
"logps/rejected": -188.53250122070312,
"loss": 0.6908,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.018942857161164284,
"rewards/margins": 0.004116528667509556,
"rewards/rejected": 0.014826327562332153,
"step": 3850
},
{
"epoch": 0.68,
"learning_rate": 8.130982367758186e-08,
"logits/chosen": -2.789405107498169,
"logits/rejected": -2.8390228748321533,
"logps/chosen": -235.29867553710938,
"logps/rejected": -248.5530548095703,
"loss": 0.6918,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.01704949513077736,
"rewards/margins": -0.0013193708145990968,
"rewards/rejected": 0.01836886629462242,
"step": 3860
},
{
"epoch": 0.68,
"learning_rate": 8.125944584382871e-08,
"logits/chosen": -2.72065806388855,
"logits/rejected": -2.7855780124664307,
"logps/chosen": -223.49081420898438,
"logps/rejected": -193.26185607910156,
"loss": 0.6912,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.013743147253990173,
"rewards/margins": 0.0023424732498824596,
"rewards/rejected": 0.011400674469769001,
"step": 3870
},
{
"epoch": 0.68,
"learning_rate": 8.120906801007557e-08,
"logits/chosen": -2.7632253170013428,
"logits/rejected": -2.6923036575317383,
"logps/chosen": -215.9404754638672,
"logps/rejected": -166.86044311523438,
"loss": 0.6916,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.017654119059443474,
"rewards/margins": 0.005568289663642645,
"rewards/rejected": 0.01208583079278469,
"step": 3880
},
{
"epoch": 0.68,
"learning_rate": 8.115869017632242e-08,
"logits/chosen": -2.7535698413848877,
"logits/rejected": -2.740983724594116,
"logps/chosen": -188.03590393066406,
"logps/rejected": -160.87303161621094,
"loss": 0.6924,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.01075964979827404,
"rewards/margins": 0.0006056831916794181,
"rewards/rejected": 0.010153967887163162,
"step": 3890
},
{
"epoch": 0.68,
"learning_rate": 8.110831234256926e-08,
"logits/chosen": -2.7618038654327393,
"logits/rejected": -2.7280309200286865,
"logps/chosen": -224.43685913085938,
"logps/rejected": -183.01840209960938,
"loss": 0.6905,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.015426975674927235,
"rewards/margins": 0.005461042746901512,
"rewards/rejected": 0.009965931996703148,
"step": 3900
},
{
"epoch": 0.68,
"learning_rate": 8.105793450881612e-08,
"logits/chosen": -2.7761223316192627,
"logits/rejected": -2.716975450515747,
"logps/chosen": -215.36886596679688,
"logps/rejected": -202.84988403320312,
"loss": 0.691,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.016212482005357742,
"rewards/margins": 0.0005874786293134093,
"rewards/rejected": 0.0156250037252903,
"step": 3910
},
{
"epoch": 0.69,
"learning_rate": 8.100755667506297e-08,
"logits/chosen": -2.7833571434020996,
"logits/rejected": -2.876706838607788,
"logps/chosen": -259.8275451660156,
"logps/rejected": -235.8184051513672,
"loss": 0.6914,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.01803353801369667,
"rewards/margins": -0.0025308975018560886,
"rewards/rejected": 0.020564435049891472,
"step": 3920
},
{
"epoch": 0.69,
"learning_rate": 8.095717884130982e-08,
"logits/chosen": -2.835965156555176,
"logits/rejected": -2.7779338359832764,
"logps/chosen": -225.6724853515625,
"logps/rejected": -188.37217712402344,
"loss": 0.6919,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.01582942344248295,
"rewards/margins": 0.0034069358371198177,
"rewards/rejected": 0.012422487139701843,
"step": 3930
},
{
"epoch": 0.69,
"learning_rate": 8.090680100755666e-08,
"logits/chosen": -2.8340446949005127,
"logits/rejected": -2.8134090900421143,
"logps/chosen": -212.24960327148438,
"logps/rejected": -182.80239868164062,
"loss": 0.6913,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.015874182805418968,
"rewards/margins": 0.004976223688572645,
"rewards/rejected": 0.01089795958250761,
"step": 3940
},
{
"epoch": 0.69,
"learning_rate": 8.085642317380352e-08,
"logits/chosen": -2.7107186317443848,
"logits/rejected": -2.705901622772217,
"logps/chosen": -207.7930450439453,
"logps/rejected": -200.37973022460938,
"loss": 0.691,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.01649567112326622,
"rewards/margins": 0.0022905156947672367,
"rewards/rejected": 0.014205153100192547,
"step": 3950
},
{
"epoch": 0.69,
"learning_rate": 8.080604534005038e-08,
"logits/chosen": -2.7393903732299805,
"logits/rejected": -2.8167338371276855,
"logps/chosen": -239.1031951904297,
"logps/rejected": -190.6559295654297,
"loss": 0.6915,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.020263103768229485,
"rewards/margins": 0.009479226544499397,
"rewards/rejected": 0.010783876292407513,
"step": 3960
},
{
"epoch": 0.7,
"learning_rate": 8.075566750629722e-08,
"logits/chosen": -2.751710891723633,
"logits/rejected": -2.804835796356201,
"logps/chosen": -216.37417602539062,
"logps/rejected": -194.0995330810547,
"loss": 0.6913,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.01658977009356022,
"rewards/margins": 0.00448748329654336,
"rewards/rejected": 0.012102288194000721,
"step": 3970
},
{
"epoch": 0.7,
"learning_rate": 8.070528967254408e-08,
"logits/chosen": -2.7608554363250732,
"logits/rejected": -2.8055953979492188,
"logps/chosen": -191.1044158935547,
"logps/rejected": -156.22952270507812,
"loss": 0.6924,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.01224413700401783,
"rewards/margins": 0.0022321634460240602,
"rewards/rejected": 0.010011972859501839,
"step": 3980
},
{
"epoch": 0.7,
"learning_rate": 8.065491183879093e-08,
"logits/chosen": -2.8037281036376953,
"logits/rejected": -2.816038131713867,
"logps/chosen": -234.3374481201172,
"logps/rejected": -193.92330932617188,
"loss": 0.6919,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.01975713111460209,
"rewards/margins": 0.006761783268302679,
"rewards/rejected": 0.012995347380638123,
"step": 3990
},
{
"epoch": 0.7,
"learning_rate": 8.060453400503778e-08,
"logits/chosen": -2.775963068008423,
"logits/rejected": -2.75541615486145,
"logps/chosen": -242.49606323242188,
"logps/rejected": -206.7489471435547,
"loss": 0.6918,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.014242658391594887,
"rewards/margins": -0.001507654320448637,
"rewards/rejected": 0.01575031317770481,
"step": 4000
},
{
"epoch": 0.7,
"learning_rate": 8.055415617128462e-08,
"logits/chosen": -2.755798816680908,
"logits/rejected": -2.765866756439209,
"logps/chosen": -191.8464813232422,
"logps/rejected": -161.7691650390625,
"loss": 0.692,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.01425481028854847,
"rewards/margins": 0.0025988915003836155,
"rewards/rejected": 0.011655919253826141,
"step": 4010
},
{
"epoch": 0.7,
"learning_rate": 8.050377833753148e-08,
"logits/chosen": -2.7568089962005615,
"logits/rejected": -2.723388671875,
"logps/chosen": -220.6444549560547,
"logps/rejected": -215.7344207763672,
"loss": 0.6921,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.017022155225276947,
"rewards/margins": 0.004023154266178608,
"rewards/rejected": 0.012999000959098339,
"step": 4020
},
{
"epoch": 0.71,
"learning_rate": 8.045340050377833e-08,
"logits/chosen": -2.7698051929473877,
"logits/rejected": -2.76641583442688,
"logps/chosen": -201.69302368164062,
"logps/rejected": -167.20213317871094,
"loss": 0.6917,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.01841864362359047,
"rewards/margins": 0.004708954133093357,
"rewards/rejected": 0.013709688559174538,
"step": 4030
},
{
"epoch": 0.71,
"learning_rate": 8.040302267002519e-08,
"logits/chosen": -2.764843225479126,
"logits/rejected": -2.7504663467407227,
"logps/chosen": -206.3531036376953,
"logps/rejected": -201.3180694580078,
"loss": 0.691,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.014857729896903038,
"rewards/margins": 0.000497685105074197,
"rewards/rejected": 0.014360045082867146,
"step": 4040
},
{
"epoch": 0.71,
"learning_rate": 8.035264483627203e-08,
"logits/chosen": -2.724370241165161,
"logits/rejected": -2.7362284660339355,
"logps/chosen": -238.0730743408203,
"logps/rejected": -218.9322052001953,
"loss": 0.6915,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.02089729532599449,
"rewards/margins": 0.005764030385762453,
"rewards/rejected": 0.0151332663372159,
"step": 4050
},
{
"epoch": 0.71,
"learning_rate": 8.030226700251888e-08,
"logits/chosen": -2.831298351287842,
"logits/rejected": -2.840911865234375,
"logps/chosen": -247.79464721679688,
"logps/rejected": -244.6702117919922,
"loss": 0.6903,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.016922039911150932,
"rewards/margins": 0.001367938588373363,
"rewards/rejected": 0.015554102137684822,
"step": 4060
},
{
"epoch": 0.71,
"learning_rate": 8.025188916876575e-08,
"logits/chosen": -2.758810043334961,
"logits/rejected": -2.7609002590179443,
"logps/chosen": -188.1548614501953,
"logps/rejected": -150.46853637695312,
"loss": 0.6911,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.015438064932823181,
"rewards/margins": 0.00756922597065568,
"rewards/rejected": 0.007868838496506214,
"step": 4070
},
{
"epoch": 0.71,
"learning_rate": 8.02015113350126e-08,
"logits/chosen": -2.7641913890838623,
"logits/rejected": -2.794325113296509,
"logps/chosen": -276.16259765625,
"logps/rejected": -221.947509765625,
"loss": 0.6908,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.01936369575560093,
"rewards/margins": 0.004809045232832432,
"rewards/rejected": 0.014554649591445923,
"step": 4080
},
{
"epoch": 0.72,
"learning_rate": 8.015113350125944e-08,
"logits/chosen": -2.7735092639923096,
"logits/rejected": -2.7139530181884766,
"logps/chosen": -217.0701904296875,
"logps/rejected": -204.7127685546875,
"loss": 0.6905,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.01837734319269657,
"rewards/margins": 0.006126923952251673,
"rewards/rejected": 0.012250418774783611,
"step": 4090
},
{
"epoch": 0.72,
"learning_rate": 8.01007556675063e-08,
"logits/chosen": -2.746734380722046,
"logits/rejected": -2.779106616973877,
"logps/chosen": -223.3635711669922,
"logps/rejected": -210.4722137451172,
"loss": 0.6915,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.022333238273859024,
"rewards/margins": 0.005000376142561436,
"rewards/rejected": 0.017332863062620163,
"step": 4100
},
{
"epoch": 0.72,
"learning_rate": 8.005037783375315e-08,
"logits/chosen": -2.761756420135498,
"logits/rejected": -2.8026602268218994,
"logps/chosen": -221.0587158203125,
"logps/rejected": -202.43582153320312,
"loss": 0.6917,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.016418827697634697,
"rewards/margins": 0.0006193307344801724,
"rewards/rejected": 0.015799496322870255,
"step": 4110
},
{
"epoch": 0.72,
"learning_rate": 8e-08,
"logits/chosen": -2.7710421085357666,
"logits/rejected": -2.744896411895752,
"logps/chosen": -226.13107299804688,
"logps/rejected": -206.2400360107422,
"loss": 0.6908,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.018721196800470352,
"rewards/margins": 0.0020058993250131607,
"rewards/rejected": 0.01671529933810234,
"step": 4120
},
{
"epoch": 0.72,
"learning_rate": 7.994962216624684e-08,
"logits/chosen": -2.695394992828369,
"logits/rejected": -2.672240734100342,
"logps/chosen": -301.8807067871094,
"logps/rejected": -241.90768432617188,
"loss": 0.6907,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.02527024783194065,
"rewards/margins": 0.009704559110105038,
"rewards/rejected": 0.01556568592786789,
"step": 4130
},
{
"epoch": 0.73,
"learning_rate": 7.98992443324937e-08,
"logits/chosen": -2.7234575748443604,
"logits/rejected": -2.7253074645996094,
"logps/chosen": -242.5963897705078,
"logps/rejected": -214.54873657226562,
"loss": 0.6907,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.019268224015831947,
"rewards/margins": 0.0059552742168307304,
"rewards/rejected": 0.013312948867678642,
"step": 4140
},
{
"epoch": 0.73,
"learning_rate": 7.984886649874055e-08,
"logits/chosen": -2.747512102127075,
"logits/rejected": -2.750851631164551,
"logps/chosen": -221.0081787109375,
"logps/rejected": -218.8545684814453,
"loss": 0.6919,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0189188402146101,
"rewards/margins": 0.0030791780445724726,
"rewards/rejected": 0.01583966240286827,
"step": 4150
},
{
"epoch": 0.73,
"learning_rate": 7.97984886649874e-08,
"logits/chosen": -2.7558045387268066,
"logits/rejected": -2.7282321453094482,
"logps/chosen": -260.65093994140625,
"logps/rejected": -205.7612762451172,
"loss": 0.6902,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.01898707076907158,
"rewards/margins": 0.004444524645805359,
"rewards/rejected": 0.01454254798591137,
"step": 4160
},
{
"epoch": 0.73,
"learning_rate": 7.974811083123424e-08,
"logits/chosen": -2.740727663040161,
"logits/rejected": -2.738755702972412,
"logps/chosen": -255.1199951171875,
"logps/rejected": -223.3599395751953,
"loss": 0.6917,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.019392380490899086,
"rewards/margins": 0.0023465738631784916,
"rewards/rejected": 0.01704580709338188,
"step": 4170
},
{
"epoch": 0.73,
"learning_rate": 7.969773299748111e-08,
"logits/chosen": -2.7931790351867676,
"logits/rejected": -2.751844644546509,
"logps/chosen": -221.10107421875,
"logps/rejected": -173.9921875,
"loss": 0.6911,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.02068236656486988,
"rewards/margins": 0.00878697820007801,
"rewards/rejected": 0.011895387433469296,
"step": 4180
},
{
"epoch": 0.73,
"learning_rate": 7.964735516372796e-08,
"logits/chosen": -2.736713409423828,
"logits/rejected": -2.7641730308532715,
"logps/chosen": -243.8798370361328,
"logps/rejected": -209.95767211914062,
"loss": 0.6912,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.022618575021624565,
"rewards/margins": 0.006286067422479391,
"rewards/rejected": 0.016332510858774185,
"step": 4190
},
{
"epoch": 0.74,
"learning_rate": 7.959697732997482e-08,
"logits/chosen": -2.768643856048584,
"logits/rejected": -2.768256902694702,
"logps/chosen": -213.690673828125,
"logps/rejected": -223.6483917236328,
"loss": 0.6914,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.01731937564909458,
"rewards/margins": 0.0022180068772286177,
"rewards/rejected": 0.015101367607712746,
"step": 4200
},
{
"epoch": 0.74,
"learning_rate": 7.954659949622166e-08,
"logits/chosen": -2.7336461544036865,
"logits/rejected": -2.7381973266601562,
"logps/chosen": -266.1100769042969,
"logps/rejected": -220.54769897460938,
"loss": 0.6909,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.018683522939682007,
"rewards/margins": 0.004539954476058483,
"rewards/rejected": 0.014143568463623524,
"step": 4210
},
{
"epoch": 0.74,
"learning_rate": 7.949622166246851e-08,
"logits/chosen": -2.7625882625579834,
"logits/rejected": -2.7351088523864746,
"logps/chosen": -222.360107421875,
"logps/rejected": -187.1444549560547,
"loss": 0.6911,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.015518203377723694,
"rewards/margins": -0.0003775197546929121,
"rewards/rejected": 0.015895724296569824,
"step": 4220
},
{
"epoch": 0.74,
"learning_rate": 7.944584382871537e-08,
"logits/chosen": -2.8258113861083984,
"logits/rejected": -2.7792856693267822,
"logps/chosen": -265.05535888671875,
"logps/rejected": -232.38101196289062,
"loss": 0.6922,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.021588006988167763,
"rewards/margins": 0.001263659680262208,
"rewards/rejected": 0.02032434567809105,
"step": 4230
},
{
"epoch": 0.74,
"learning_rate": 7.939546599496222e-08,
"logits/chosen": -2.855884075164795,
"logits/rejected": -2.7981677055358887,
"logps/chosen": -241.37246704101562,
"logps/rejected": -197.73507690429688,
"loss": 0.6913,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.017666930332779884,
"rewards/margins": -0.0018121827160939574,
"rewards/rejected": 0.019479114562273026,
"step": 4240
},
{
"epoch": 0.74,
"learning_rate": 7.934508816120906e-08,
"logits/chosen": -2.769641160964966,
"logits/rejected": -2.7314181327819824,
"logps/chosen": -241.15615844726562,
"logps/rejected": -221.33547973632812,
"loss": 0.6911,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.023081984370946884,
"rewards/margins": 0.005661494564265013,
"rewards/rejected": 0.017420491203665733,
"step": 4250
},
{
"epoch": 0.75,
"learning_rate": 7.929471032745591e-08,
"logits/chosen": -2.743436813354492,
"logits/rejected": -2.6626510620117188,
"logps/chosen": -228.18014526367188,
"logps/rejected": -220.50277709960938,
"loss": 0.6914,
"rewards/accuracies": 0.3499999940395355,
"rewards/chosen": 0.01799473538994789,
"rewards/margins": -0.0007408105302602053,
"rewards/rejected": 0.018735546618700027,
"step": 4260
},
{
"epoch": 0.75,
"learning_rate": 7.924433249370277e-08,
"logits/chosen": -2.8057007789611816,
"logits/rejected": -2.7800495624542236,
"logps/chosen": -263.08514404296875,
"logps/rejected": -211.67666625976562,
"loss": 0.6907,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.02124876156449318,
"rewards/margins": 0.009110869839787483,
"rewards/rejected": 0.012137891724705696,
"step": 4270
},
{
"epoch": 0.75,
"learning_rate": 7.919395465994961e-08,
"logits/chosen": -2.7258174419403076,
"logits/rejected": -2.7756786346435547,
"logps/chosen": -193.611083984375,
"logps/rejected": -179.30149841308594,
"loss": 0.6917,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.016186311841011047,
"rewards/margins": 0.0020093251951038837,
"rewards/rejected": 0.0141769889742136,
"step": 4280
},
{
"epoch": 0.75,
"learning_rate": 7.914357682619647e-08,
"logits/chosen": -2.7517471313476562,
"logits/rejected": -2.734189987182617,
"logps/chosen": -230.6570281982422,
"logps/rejected": -202.70420837402344,
"loss": 0.6913,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.02114647440612316,
"rewards/margins": 0.0036278795450925827,
"rewards/rejected": 0.01751859486103058,
"step": 4290
},
{
"epoch": 0.75,
"learning_rate": 7.909319899244333e-08,
"logits/chosen": -2.730635166168213,
"logits/rejected": -2.7385268211364746,
"logps/chosen": -198.06155395507812,
"logps/rejected": -176.04498291015625,
"loss": 0.6911,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.016498813405632973,
"rewards/margins": 0.001804836094379425,
"rewards/rejected": 0.014693977311253548,
"step": 4300
},
{
"epoch": 0.75,
"learning_rate": 7.904282115869018e-08,
"logits/chosen": -2.7733383178710938,
"logits/rejected": -2.792484998703003,
"logps/chosen": -191.0068817138672,
"logps/rejected": -161.52700805664062,
"loss": 0.6915,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.014926761388778687,
"rewards/margins": 0.004622498992830515,
"rewards/rejected": 0.010304262861609459,
"step": 4310
},
{
"epoch": 0.76,
"learning_rate": 7.899244332493702e-08,
"logits/chosen": -2.768362522125244,
"logits/rejected": -2.8112378120422363,
"logps/chosen": -214.1084747314453,
"logps/rejected": -185.85166931152344,
"loss": 0.6909,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.018819646909832954,
"rewards/margins": 0.007635760121047497,
"rewards/rejected": 0.011183887720108032,
"step": 4320
},
{
"epoch": 0.76,
"learning_rate": 7.894206549118388e-08,
"logits/chosen": -2.7518534660339355,
"logits/rejected": -2.765934467315674,
"logps/chosen": -199.8416748046875,
"logps/rejected": -181.0721893310547,
"loss": 0.6917,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.018102090805768967,
"rewards/margins": -0.00039173493860289454,
"rewards/rejected": 0.01849382556974888,
"step": 4330
},
{
"epoch": 0.76,
"learning_rate": 7.889168765743073e-08,
"logits/chosen": -2.7839748859405518,
"logits/rejected": -2.7550039291381836,
"logps/chosen": -263.43011474609375,
"logps/rejected": -206.5287322998047,
"loss": 0.6909,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.02562366984784603,
"rewards/margins": 0.008644169196486473,
"rewards/rejected": 0.01697949692606926,
"step": 4340
},
{
"epoch": 0.76,
"learning_rate": 7.884130982367758e-08,
"logits/chosen": -2.734191417694092,
"logits/rejected": -2.6990275382995605,
"logps/chosen": -223.6094970703125,
"logps/rejected": -209.64791870117188,
"loss": 0.6911,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.01814252696931362,
"rewards/margins": 0.0009969560196623206,
"rewards/rejected": 0.017145570367574692,
"step": 4350
},
{
"epoch": 0.76,
"learning_rate": 7.879093198992442e-08,
"logits/chosen": -2.7549777030944824,
"logits/rejected": -2.7530622482299805,
"logps/chosen": -267.322998046875,
"logps/rejected": -225.5402069091797,
"loss": 0.6912,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.018788613379001617,
"rewards/margins": -0.0013716205721721053,
"rewards/rejected": 0.020160233601927757,
"step": 4360
},
{
"epoch": 0.77,
"learning_rate": 7.874055415617128e-08,
"logits/chosen": -2.8316569328308105,
"logits/rejected": -2.7772135734558105,
"logps/chosen": -238.33383178710938,
"logps/rejected": -207.7853240966797,
"loss": 0.6916,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.021232271566987038,
"rewards/margins": 0.0057861944660544395,
"rewards/rejected": 0.015446076169610023,
"step": 4370
},
{
"epoch": 0.77,
"learning_rate": 7.869017632241813e-08,
"logits/chosen": -2.7817704677581787,
"logits/rejected": -2.724588632583618,
"logps/chosen": -211.82650756835938,
"logps/rejected": -178.63743591308594,
"loss": 0.6916,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.01910659857094288,
"rewards/margins": 0.004909339360892773,
"rewards/rejected": 0.014197258278727531,
"step": 4380
},
{
"epoch": 0.77,
"learning_rate": 7.863979848866498e-08,
"logits/chosen": -2.7254724502563477,
"logits/rejected": -2.802567958831787,
"logps/chosen": -213.8620147705078,
"logps/rejected": -179.79685974121094,
"loss": 0.6911,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02377455309033394,
"rewards/margins": 0.004999110009521246,
"rewards/rejected": 0.018775442615151405,
"step": 4390
},
{
"epoch": 0.77,
"learning_rate": 7.858942065491184e-08,
"logits/chosen": -2.7992103099823,
"logits/rejected": -2.742579698562622,
"logps/chosen": -259.1708984375,
"logps/rejected": -212.4176483154297,
"loss": 0.6905,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.025623898953199387,
"rewards/margins": 0.008028807118535042,
"rewards/rejected": 0.017595095559954643,
"step": 4400
},
{
"epoch": 0.77,
"learning_rate": 7.853904282115869e-08,
"logits/chosen": -2.7983293533325195,
"logits/rejected": -2.760340929031372,
"logps/chosen": -238.68203735351562,
"logps/rejected": -205.7268524169922,
"loss": 0.6889,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.022161977365612984,
"rewards/margins": 0.008466407656669617,
"rewards/rejected": 0.013695569708943367,
"step": 4410
},
{
"epoch": 0.77,
"learning_rate": 7.848866498740554e-08,
"logits/chosen": -2.7707414627075195,
"logits/rejected": -2.666015148162842,
"logps/chosen": -267.7262268066406,
"logps/rejected": -229.92568969726562,
"loss": 0.6911,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.02798035740852356,
"rewards/margins": 0.0134460823610425,
"rewards/rejected": 0.01453427691012621,
"step": 4420
},
{
"epoch": 0.78,
"learning_rate": 7.84382871536524e-08,
"logits/chosen": -2.7728307247161865,
"logits/rejected": -2.748939275741577,
"logps/chosen": -241.35791015625,
"logps/rejected": -208.1006622314453,
"loss": 0.6919,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02361791953444481,
"rewards/margins": 0.006282551679760218,
"rewards/rejected": 0.01733536645770073,
"step": 4430
},
{
"epoch": 0.78,
"learning_rate": 7.838790931989924e-08,
"logits/chosen": -2.751283645629883,
"logits/rejected": -2.7884583473205566,
"logps/chosen": -230.86865234375,
"logps/rejected": -205.05746459960938,
"loss": 0.6905,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.01816331408917904,
"rewards/margins": 0.0020460118539631367,
"rewards/rejected": 0.01611730083823204,
"step": 4440
},
{
"epoch": 0.78,
"learning_rate": 7.833753148614609e-08,
"logits/chosen": -2.7546162605285645,
"logits/rejected": -2.7503271102905273,
"logps/chosen": -237.634765625,
"logps/rejected": -209.13125610351562,
"loss": 0.6905,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.021774889901280403,
"rewards/margins": 0.007742063608020544,
"rewards/rejected": 0.014032823964953423,
"step": 4450
},
{
"epoch": 0.78,
"learning_rate": 7.828715365239295e-08,
"logits/chosen": -2.7621121406555176,
"logits/rejected": -2.7742960453033447,
"logps/chosen": -217.29983520507812,
"logps/rejected": -208.7975616455078,
"loss": 0.6914,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.023997284471988678,
"rewards/margins": 0.005684687290340662,
"rewards/rejected": 0.018312597647309303,
"step": 4460
},
{
"epoch": 0.78,
"learning_rate": 7.82367758186398e-08,
"logits/chosen": -2.711585521697998,
"logits/rejected": -2.713052988052368,
"logps/chosen": -249.82479858398438,
"logps/rejected": -200.6315155029297,
"loss": 0.692,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.019304895773530006,
"rewards/margins": 0.0010892207501456141,
"rewards/rejected": 0.01821567490696907,
"step": 4470
},
{
"epoch": 0.78,
"learning_rate": 7.818639798488664e-08,
"logits/chosen": -2.705024242401123,
"logits/rejected": -2.74556565284729,
"logps/chosen": -194.25546264648438,
"logps/rejected": -171.3458251953125,
"loss": 0.6905,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.011694484390318394,
"rewards/margins": 0.0016950942808762193,
"rewards/rejected": 0.009999390691518784,
"step": 4480
},
{
"epoch": 0.79,
"learning_rate": 7.81360201511335e-08,
"logits/chosen": -2.7292304039001465,
"logits/rejected": -2.7129428386688232,
"logps/chosen": -209.78079223632812,
"logps/rejected": -241.6830291748047,
"loss": 0.6911,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.012067977339029312,
"rewards/margins": -0.0037381560541689396,
"rewards/rejected": 0.015806132927536964,
"step": 4490
},
{
"epoch": 0.79,
"learning_rate": 7.808564231738035e-08,
"logits/chosen": -2.8351051807403564,
"logits/rejected": -2.7264862060546875,
"logps/chosen": -220.93252563476562,
"logps/rejected": -205.50259399414062,
"loss": 0.6917,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.02219536155462265,
"rewards/margins": 0.00513820443302393,
"rewards/rejected": 0.017057154327630997,
"step": 4500
},
{
"epoch": 0.79,
"learning_rate": 7.80352644836272e-08,
"logits/chosen": -2.785386323928833,
"logits/rejected": -2.7174456119537354,
"logps/chosen": -234.05874633789062,
"logps/rejected": -205.1448974609375,
"loss": 0.6909,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.018111255019903183,
"rewards/margins": 0.004342755768448114,
"rewards/rejected": 0.013768496923148632,
"step": 4510
},
{
"epoch": 0.79,
"learning_rate": 7.798488664987405e-08,
"logits/chosen": -2.7610111236572266,
"logits/rejected": -2.6893057823181152,
"logps/chosen": -215.45077514648438,
"logps/rejected": -212.09848022460938,
"loss": 0.6914,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.01872086152434349,
"rewards/margins": -0.00038822871283628047,
"rewards/rejected": 0.01910909079015255,
"step": 4520
},
{
"epoch": 0.79,
"learning_rate": 7.793450881612091e-08,
"logits/chosen": -2.790309429168701,
"logits/rejected": -2.8239731788635254,
"logps/chosen": -251.9709014892578,
"logps/rejected": -204.56088256835938,
"loss": 0.6902,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.02696056105196476,
"rewards/margins": 0.0066688829101622105,
"rewards/rejected": 0.020291678607463837,
"step": 4530
},
{
"epoch": 0.8,
"learning_rate": 7.788413098236776e-08,
"logits/chosen": -2.8395566940307617,
"logits/rejected": -2.781035900115967,
"logps/chosen": -239.2814483642578,
"logps/rejected": -189.88824462890625,
"loss": 0.6907,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.022276435047388077,
"rewards/margins": 0.00612932164222002,
"rewards/rejected": 0.01614711619913578,
"step": 4540
},
{
"epoch": 0.8,
"learning_rate": 7.783375314861462e-08,
"logits/chosen": -2.777453899383545,
"logits/rejected": -2.7720651626586914,
"logps/chosen": -277.6221008300781,
"logps/rejected": -232.5399932861328,
"loss": 0.6914,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.022800957784056664,
"rewards/margins": 0.006417891476303339,
"rewards/rejected": 0.016383066773414612,
"step": 4550
},
{
"epoch": 0.8,
"learning_rate": 7.778337531486146e-08,
"logits/chosen": -2.8126351833343506,
"logits/rejected": -2.748579263687134,
"logps/chosen": -235.12881469726562,
"logps/rejected": -250.25527954101562,
"loss": 0.6913,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.024302994832396507,
"rewards/margins": 0.005716138519346714,
"rewards/rejected": 0.01858685538172722,
"step": 4560
},
{
"epoch": 0.8,
"learning_rate": 7.773299748110831e-08,
"logits/chosen": -2.7417664527893066,
"logits/rejected": -2.736534833908081,
"logps/chosen": -251.11880493164062,
"logps/rejected": -205.9317169189453,
"loss": 0.6902,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.021253764629364014,
"rewards/margins": 0.006818639580160379,
"rewards/rejected": 0.014435125514864922,
"step": 4570
},
{
"epoch": 0.8,
"learning_rate": 7.768261964735516e-08,
"logits/chosen": -2.879304885864258,
"logits/rejected": -2.8242783546447754,
"logps/chosen": -260.59454345703125,
"logps/rejected": -209.79367065429688,
"loss": 0.6904,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0261318888515234,
"rewards/margins": 0.007015122566372156,
"rewards/rejected": 0.01911676675081253,
"step": 4580
},
{
"epoch": 0.8,
"learning_rate": 7.7632241813602e-08,
"logits/chosen": -2.7443363666534424,
"logits/rejected": -2.663283348083496,
"logps/chosen": -227.0984649658203,
"logps/rejected": -207.4261016845703,
"loss": 0.691,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.020075734704732895,
"rewards/margins": 0.0018470725044608116,
"rewards/rejected": 0.01822866126894951,
"step": 4590
},
{
"epoch": 0.81,
"learning_rate": 7.758186397984886e-08,
"logits/chosen": -2.765794277191162,
"logits/rejected": -2.7267675399780273,
"logps/chosen": -227.9505615234375,
"logps/rejected": -175.19935607910156,
"loss": 0.6886,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.01690318062901497,
"rewards/margins": 0.005889912601560354,
"rewards/rejected": 0.011013267561793327,
"step": 4600
},
{
"epoch": 0.81,
"learning_rate": 7.753148614609571e-08,
"logits/chosen": -2.7460758686065674,
"logits/rejected": -2.7646918296813965,
"logps/chosen": -255.68576049804688,
"logps/rejected": -223.80899047851562,
"loss": 0.6902,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.025373512879014015,
"rewards/margins": 0.004764680750668049,
"rewards/rejected": 0.02060883305966854,
"step": 4610
},
{
"epoch": 0.81,
"learning_rate": 7.748110831234256e-08,
"logits/chosen": -2.7983150482177734,
"logits/rejected": -2.815904140472412,
"logps/chosen": -246.80892944335938,
"logps/rejected": -207.28793334960938,
"loss": 0.6924,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.02356107532978058,
"rewards/margins": 0.0033489782363176346,
"rewards/rejected": 0.020212098956108093,
"step": 4620
},
{
"epoch": 0.81,
"learning_rate": 7.743073047858942e-08,
"logits/chosen": -2.726724147796631,
"logits/rejected": -2.7251830101013184,
"logps/chosen": -203.96339416503906,
"logps/rejected": -179.08773803710938,
"loss": 0.6912,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.018438972532749176,
"rewards/margins": 0.0032338383607566357,
"rewards/rejected": 0.015205135568976402,
"step": 4630
},
{
"epoch": 0.81,
"learning_rate": 7.738035264483627e-08,
"logits/chosen": -2.799243688583374,
"logits/rejected": -2.757625102996826,
"logps/chosen": -231.72024536132812,
"logps/rejected": -194.36715698242188,
"loss": 0.6908,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.02035854198038578,
"rewards/margins": 0.003642552299425006,
"rewards/rejected": 0.016715990379452705,
"step": 4640
},
{
"epoch": 0.81,
"learning_rate": 7.732997481108313e-08,
"logits/chosen": -2.8015732765197754,
"logits/rejected": -2.7627758979797363,
"logps/chosen": -225.84866333007812,
"logps/rejected": -202.64268493652344,
"loss": 0.6912,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.017703380435705185,
"rewards/margins": 0.0011888284934684634,
"rewards/rejected": 0.016514552757143974,
"step": 4650
},
{
"epoch": 0.82,
"learning_rate": 7.727959697732998e-08,
"logits/chosen": -2.7188124656677246,
"logits/rejected": -2.758882522583008,
"logps/chosen": -228.21188354492188,
"logps/rejected": -214.9092254638672,
"loss": 0.6903,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.024845756590366364,
"rewards/margins": 0.006363884545862675,
"rewards/rejected": 0.018481872975826263,
"step": 4660
},
{
"epoch": 0.82,
"learning_rate": 7.722921914357682e-08,
"logits/chosen": -2.81644344329834,
"logits/rejected": -2.7707905769348145,
"logps/chosen": -243.9435272216797,
"logps/rejected": -188.6251983642578,
"loss": 0.69,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.026427235454320908,
"rewards/margins": 0.011382916942238808,
"rewards/rejected": 0.015044321306049824,
"step": 4670
},
{
"epoch": 0.82,
"learning_rate": 7.717884130982367e-08,
"logits/chosen": -2.7194998264312744,
"logits/rejected": -2.8078126907348633,
"logps/chosen": -220.48046875,
"logps/rejected": -195.44012451171875,
"loss": 0.6904,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.019193807616829872,
"rewards/margins": 0.003940016962587833,
"rewards/rejected": 0.015253791585564613,
"step": 4680
},
{
"epoch": 0.82,
"learning_rate": 7.712846347607053e-08,
"logits/chosen": -2.745544910430908,
"logits/rejected": -2.796077013015747,
"logps/chosen": -242.34103393554688,
"logps/rejected": -186.40908813476562,
"loss": 0.6915,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.02268916554749012,
"rewards/margins": 0.006848675664514303,
"rewards/rejected": 0.01584048941731453,
"step": 4690
},
{
"epoch": 0.82,
"learning_rate": 7.707808564231738e-08,
"logits/chosen": -2.7313311100006104,
"logits/rejected": -2.718033790588379,
"logps/chosen": -180.11282348632812,
"logps/rejected": -193.9093780517578,
"loss": 0.691,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.013201892375946045,
"rewards/margins": 0.001982487738132477,
"rewards/rejected": 0.011219402775168419,
"step": 4700
},
{
"epoch": 0.83,
"learning_rate": 7.702770780856422e-08,
"logits/chosen": -2.7362091541290283,
"logits/rejected": -2.6564507484436035,
"logps/chosen": -245.69277954101562,
"logps/rejected": -222.1023406982422,
"loss": 0.6913,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.024562204256653786,
"rewards/margins": 0.0058278171345591545,
"rewards/rejected": 0.018734386190772057,
"step": 4710
},
{
"epoch": 0.83,
"learning_rate": 7.697732997481107e-08,
"logits/chosen": -2.7647807598114014,
"logits/rejected": -2.748202323913574,
"logps/chosen": -207.46826171875,
"logps/rejected": -204.72366333007812,
"loss": 0.6903,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.017461542040109634,
"rewards/margins": -1.7283111446886323e-05,
"rewards/rejected": 0.01747882552444935,
"step": 4720
},
{
"epoch": 0.83,
"learning_rate": 7.692695214105793e-08,
"logits/chosen": -2.8048958778381348,
"logits/rejected": -2.830275058746338,
"logps/chosen": -256.74993896484375,
"logps/rejected": -186.250732421875,
"loss": 0.691,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02503347396850586,
"rewards/margins": 0.007637057453393936,
"rewards/rejected": 0.017396416515111923,
"step": 4730
},
{
"epoch": 0.83,
"learning_rate": 7.687657430730478e-08,
"logits/chosen": -2.7937734127044678,
"logits/rejected": -2.771660089492798,
"logps/chosen": -243.90585327148438,
"logps/rejected": -215.63577270507812,
"loss": 0.6915,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.021137814968824387,
"rewards/margins": -0.0011193671962246299,
"rewards/rejected": 0.022257182747125626,
"step": 4740
},
{
"epoch": 0.83,
"learning_rate": 7.682619647355164e-08,
"logits/chosen": -2.7488274574279785,
"logits/rejected": -2.817153215408325,
"logps/chosen": -236.9940643310547,
"logps/rejected": -228.24642944335938,
"loss": 0.6908,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.024236269295215607,
"rewards/margins": 0.002860927488654852,
"rewards/rejected": 0.021375341340899467,
"step": 4750
},
{
"epoch": 0.83,
"learning_rate": 7.677581863979849e-08,
"logits/chosen": -2.7421677112579346,
"logits/rejected": -2.767341375350952,
"logps/chosen": -226.1661834716797,
"logps/rejected": -179.6350860595703,
"loss": 0.6901,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.027445446699857712,
"rewards/margins": 0.007057595998048782,
"rewards/rejected": 0.02038785070180893,
"step": 4760
},
{
"epoch": 0.84,
"learning_rate": 7.672544080604534e-08,
"logits/chosen": -2.817746877670288,
"logits/rejected": -2.760152578353882,
"logps/chosen": -229.91854858398438,
"logps/rejected": -194.99644470214844,
"loss": 0.6915,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.02216922864317894,
"rewards/margins": 0.008342455141246319,
"rewards/rejected": 0.013826772570610046,
"step": 4770
},
{
"epoch": 0.84,
"learning_rate": 7.66750629722922e-08,
"logits/chosen": -2.8346447944641113,
"logits/rejected": -2.751246690750122,
"logps/chosen": -250.40609741210938,
"logps/rejected": -210.5948944091797,
"loss": 0.6904,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.024279357865452766,
"rewards/margins": 0.005712731741368771,
"rewards/rejected": 0.01856662891805172,
"step": 4780
},
{
"epoch": 0.84,
"learning_rate": 7.662468513853904e-08,
"logits/chosen": -2.7878410816192627,
"logits/rejected": -2.7772955894470215,
"logps/chosen": -237.049560546875,
"logps/rejected": -193.94973754882812,
"loss": 0.6915,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.021299934014678,
"rewards/margins": 0.004049413371831179,
"rewards/rejected": 0.01725051924586296,
"step": 4790
},
{
"epoch": 0.84,
"learning_rate": 7.657430730478589e-08,
"logits/chosen": -2.7216315269470215,
"logits/rejected": -2.725965976715088,
"logps/chosen": -260.41021728515625,
"logps/rejected": -253.3103790283203,
"loss": 0.692,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.025030773133039474,
"rewards/margins": 0.001364406431093812,
"rewards/rejected": 0.023666368797421455,
"step": 4800
},
{
"epoch": 0.84,
"learning_rate": 7.652392947103274e-08,
"logits/chosen": -2.7526895999908447,
"logits/rejected": -2.783440589904785,
"logps/chosen": -233.69204711914062,
"logps/rejected": -257.5528564453125,
"loss": 0.6915,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.0172027088701725,
"rewards/margins": -0.000673537200782448,
"rewards/rejected": 0.017876241356134415,
"step": 4810
},
{
"epoch": 0.84,
"learning_rate": 7.64735516372796e-08,
"logits/chosen": -2.697016477584839,
"logits/rejected": -2.7442197799682617,
"logps/chosen": -241.70361328125,
"logps/rejected": -219.9405059814453,
"loss": 0.6904,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.028333717957139015,
"rewards/margins": 0.009502708911895752,
"rewards/rejected": 0.018831010907888412,
"step": 4820
},
{
"epoch": 0.85,
"learning_rate": 7.642317380352644e-08,
"logits/chosen": -2.792147397994995,
"logits/rejected": -2.752933979034424,
"logps/chosen": -263.72259521484375,
"logps/rejected": -222.4014434814453,
"loss": 0.6912,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.023669295012950897,
"rewards/margins": 0.0015563804190605879,
"rewards/rejected": 0.02211291715502739,
"step": 4830
},
{
"epoch": 0.85,
"learning_rate": 7.637279596977329e-08,
"logits/chosen": -2.744185447692871,
"logits/rejected": -2.718427896499634,
"logps/chosen": -266.70318603515625,
"logps/rejected": -220.90786743164062,
"loss": 0.6904,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.02698015235364437,
"rewards/margins": 0.007942819967865944,
"rewards/rejected": 0.019037332385778427,
"step": 4840
},
{
"epoch": 0.85,
"learning_rate": 7.632241813602014e-08,
"logits/chosen": -2.786680221557617,
"logits/rejected": -2.7786288261413574,
"logps/chosen": -223.2958221435547,
"logps/rejected": -175.2308807373047,
"loss": 0.6914,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.019782308489084244,
"rewards/margins": 0.007503434084355831,
"rewards/rejected": 0.012278875336050987,
"step": 4850
},
{
"epoch": 0.85,
"learning_rate": 7.6272040302267e-08,
"logits/chosen": -2.7439236640930176,
"logits/rejected": -2.754936695098877,
"logps/chosen": -196.223876953125,
"logps/rejected": -198.14244079589844,
"loss": 0.6913,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.021982144564390182,
"rewards/margins": 0.003115237457677722,
"rewards/rejected": 0.018866905942559242,
"step": 4860
},
{
"epoch": 0.85,
"learning_rate": 7.622166246851385e-08,
"logits/chosen": -2.718632221221924,
"logits/rejected": -2.7445740699768066,
"logps/chosen": -230.5083465576172,
"logps/rejected": -186.44937133789062,
"loss": 0.6923,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.026937445625662804,
"rewards/margins": 0.0090105552226305,
"rewards/rejected": 0.017926890403032303,
"step": 4870
},
{
"epoch": 0.85,
"learning_rate": 7.61712846347607e-08,
"logits/chosen": -2.8068249225616455,
"logits/rejected": -2.7692713737487793,
"logps/chosen": -246.0875701904297,
"logps/rejected": -199.01675415039062,
"loss": 0.6914,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.02345597743988037,
"rewards/margins": 0.007212613709270954,
"rewards/rejected": 0.01624336466193199,
"step": 4880
},
{
"epoch": 0.86,
"learning_rate": 7.612090680100756e-08,
"logits/chosen": -2.745042324066162,
"logits/rejected": -2.815016746520996,
"logps/chosen": -257.94610595703125,
"logps/rejected": -189.48870849609375,
"loss": 0.6908,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.023482834920287132,
"rewards/margins": 0.006505007389932871,
"rewards/rejected": 0.01697782799601555,
"step": 4890
},
{
"epoch": 0.86,
"learning_rate": 7.60705289672544e-08,
"logits/chosen": -2.661994695663452,
"logits/rejected": -2.670673131942749,
"logps/chosen": -239.2667236328125,
"logps/rejected": -215.118408203125,
"loss": 0.6902,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.029827941209077835,
"rewards/margins": 0.0076766968704760075,
"rewards/rejected": 0.022151242941617966,
"step": 4900
},
{
"epoch": 0.86,
"learning_rate": 7.602015113350125e-08,
"logits/chosen": -2.7965893745422363,
"logits/rejected": -2.8132386207580566,
"logps/chosen": -246.4945831298828,
"logps/rejected": -211.777587890625,
"loss": 0.6912,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.0261533260345459,
"rewards/margins": 0.006919356994330883,
"rewards/rejected": 0.01923396997153759,
"step": 4910
},
{
"epoch": 0.86,
"learning_rate": 7.596977329974811e-08,
"logits/chosen": -2.790916919708252,
"logits/rejected": -2.753495693206787,
"logps/chosen": -231.7954864501953,
"logps/rejected": -226.02127075195312,
"loss": 0.6912,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.021478954702615738,
"rewards/margins": 0.001239580800756812,
"rewards/rejected": 0.020239371806383133,
"step": 4920
},
{
"epoch": 0.86,
"learning_rate": 7.591939546599496e-08,
"logits/chosen": -2.7043099403381348,
"logits/rejected": -2.789663314819336,
"logps/chosen": -261.9654541015625,
"logps/rejected": -234.9620361328125,
"loss": 0.6906,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03034358285367489,
"rewards/margins": 0.005865463055670261,
"rewards/rejected": 0.024478118866682053,
"step": 4930
},
{
"epoch": 0.87,
"learning_rate": 7.58690176322418e-08,
"logits/chosen": -2.813978672027588,
"logits/rejected": -2.751081943511963,
"logps/chosen": -250.8798370361328,
"logps/rejected": -239.74002075195312,
"loss": 0.6918,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.028360417112708092,
"rewards/margins": 0.006048205774277449,
"rewards/rejected": 0.022312210872769356,
"step": 4940
},
{
"epoch": 0.87,
"learning_rate": 7.581863979848865e-08,
"logits/chosen": -2.7854201793670654,
"logits/rejected": -2.7969956398010254,
"logps/chosen": -218.26541137695312,
"logps/rejected": -190.56585693359375,
"loss": 0.6916,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.02540905773639679,
"rewards/margins": 0.004594909492880106,
"rewards/rejected": 0.02081414684653282,
"step": 4950
},
{
"epoch": 0.87,
"learning_rate": 7.576826196473551e-08,
"logits/chosen": -2.758981943130493,
"logits/rejected": -2.732278347015381,
"logps/chosen": -238.2212371826172,
"logps/rejected": -241.3662872314453,
"loss": 0.6913,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.024932190775871277,
"rewards/margins": 0.002725116442888975,
"rewards/rejected": 0.022207075729966164,
"step": 4960
},
{
"epoch": 0.87,
"learning_rate": 7.571788413098236e-08,
"logits/chosen": -2.749824285507202,
"logits/rejected": -2.7466375827789307,
"logps/chosen": -263.97076416015625,
"logps/rejected": -213.78076171875,
"loss": 0.6899,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.03015116974711418,
"rewards/margins": 0.01208040677011013,
"rewards/rejected": 0.0180707648396492,
"step": 4970
},
{
"epoch": 0.87,
"learning_rate": 7.566750629722922e-08,
"logits/chosen": -2.728415012359619,
"logits/rejected": -2.7121329307556152,
"logps/chosen": -240.95773315429688,
"logps/rejected": -253.390380859375,
"loss": 0.6916,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.02616221271455288,
"rewards/margins": 0.0012474370887503028,
"rewards/rejected": 0.024914775043725967,
"step": 4980
},
{
"epoch": 0.87,
"learning_rate": 7.561712846347607e-08,
"logits/chosen": -2.7221524715423584,
"logits/rejected": -2.7137563228607178,
"logps/chosen": -244.83627319335938,
"logps/rejected": -194.1187744140625,
"loss": 0.6905,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.023836804553866386,
"rewards/margins": 0.005772692617028952,
"rewards/rejected": 0.018064109608530998,
"step": 4990
},
{
"epoch": 0.88,
"learning_rate": 7.556675062972292e-08,
"logits/chosen": -2.7389016151428223,
"logits/rejected": -2.7844491004943848,
"logps/chosen": -258.43865966796875,
"logps/rejected": -235.6800079345703,
"loss": 0.6902,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.024131130427122116,
"rewards/margins": 0.007521049585193396,
"rewards/rejected": 0.016610082238912582,
"step": 5000
},
{
"epoch": 0.88,
"learning_rate": 7.551637279596978e-08,
"logits/chosen": -2.7731165885925293,
"logits/rejected": -2.6811578273773193,
"logps/chosen": -205.5344696044922,
"logps/rejected": -183.38037109375,
"loss": 0.6902,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.016569796949625015,
"rewards/margins": -0.002280243206769228,
"rewards/rejected": 0.018850039690732956,
"step": 5010
},
{
"epoch": 0.88,
"learning_rate": 7.546599496221662e-08,
"logits/chosen": -2.7271320819854736,
"logits/rejected": -2.809903144836426,
"logps/chosen": -206.69082641601562,
"logps/rejected": -222.5525360107422,
"loss": 0.6902,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.017895519733428955,
"rewards/margins": 0.00183036585804075,
"rewards/rejected": 0.01606515422463417,
"step": 5020
},
{
"epoch": 0.88,
"learning_rate": 7.541561712846347e-08,
"logits/chosen": -2.7593743801116943,
"logits/rejected": -2.7369823455810547,
"logps/chosen": -215.10879516601562,
"logps/rejected": -209.2699737548828,
"loss": 0.6911,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.023434340953826904,
"rewards/margins": 0.00012367055751383305,
"rewards/rejected": 0.023310670629143715,
"step": 5030
},
{
"epoch": 0.88,
"learning_rate": 7.536523929471032e-08,
"logits/chosen": -2.748511791229248,
"logits/rejected": -2.74576997756958,
"logps/chosen": -233.9241180419922,
"logps/rejected": -241.55917358398438,
"loss": 0.6903,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.02254708856344223,
"rewards/margins": 0.002134478185325861,
"rewards/rejected": 0.020412612706422806,
"step": 5040
},
{
"epoch": 0.88,
"learning_rate": 7.531486146095718e-08,
"logits/chosen": -2.7883503437042236,
"logits/rejected": -2.765450954437256,
"logps/chosen": -194.64598083496094,
"logps/rejected": -229.24850463867188,
"loss": 0.6905,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.024526655673980713,
"rewards/margins": -0.0027814474888145924,
"rewards/rejected": 0.027308102697134018,
"step": 5050
},
{
"epoch": 0.89,
"learning_rate": 7.526448362720402e-08,
"logits/chosen": -2.714806318283081,
"logits/rejected": -2.6766140460968018,
"logps/chosen": -248.44253540039062,
"logps/rejected": -229.79556274414062,
"loss": 0.6907,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.027913689613342285,
"rewards/margins": 0.005528334993869066,
"rewards/rejected": 0.022385356947779655,
"step": 5060
},
{
"epoch": 0.89,
"learning_rate": 7.521410579345087e-08,
"logits/chosen": -2.7708027362823486,
"logits/rejected": -2.7898004055023193,
"logps/chosen": -224.08193969726562,
"logps/rejected": -220.9014129638672,
"loss": 0.6907,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.027087047696113586,
"rewards/margins": 0.004851869307458401,
"rewards/rejected": 0.02223517931997776,
"step": 5070
},
{
"epoch": 0.89,
"learning_rate": 7.516372795969773e-08,
"logits/chosen": -2.7174248695373535,
"logits/rejected": -2.741032123565674,
"logps/chosen": -198.52511596679688,
"logps/rejected": -177.54678344726562,
"loss": 0.6893,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.020215127617120743,
"rewards/margins": 0.0038847383111715317,
"rewards/rejected": 0.016330387443304062,
"step": 5080
},
{
"epoch": 0.89,
"learning_rate": 7.511335012594458e-08,
"logits/chosen": -2.718716859817505,
"logits/rejected": -2.748931407928467,
"logps/chosen": -251.72378540039062,
"logps/rejected": -226.3111114501953,
"loss": 0.6916,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02789355255663395,
"rewards/margins": 0.0028011654503643513,
"rewards/rejected": 0.025092383846640587,
"step": 5090
},
{
"epoch": 0.89,
"learning_rate": 7.506297229219143e-08,
"logits/chosen": -2.720767021179199,
"logits/rejected": -2.744206666946411,
"logps/chosen": -257.54852294921875,
"logps/rejected": -162.34461975097656,
"loss": 0.6903,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.029418539255857468,
"rewards/margins": 0.013503951020538807,
"rewards/rejected": 0.015914589166641235,
"step": 5100
},
{
"epoch": 0.9,
"learning_rate": 7.501259445843829e-08,
"logits/chosen": -2.801480293273926,
"logits/rejected": -2.8004708290100098,
"logps/chosen": -250.4967803955078,
"logps/rejected": -197.5179901123047,
"loss": 0.6895,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.024577541276812553,
"rewards/margins": 0.010709354653954506,
"rewards/rejected": 0.013868187554180622,
"step": 5110
},
{
"epoch": 0.9,
"learning_rate": 7.496221662468514e-08,
"logits/chosen": -2.754500389099121,
"logits/rejected": -2.7321605682373047,
"logps/chosen": -211.9841766357422,
"logps/rejected": -153.45176696777344,
"loss": 0.6904,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.02272544428706169,
"rewards/margins": 0.012496823444962502,
"rewards/rejected": 0.01022862084209919,
"step": 5120
},
{
"epoch": 0.9,
"learning_rate": 7.4911838790932e-08,
"logits/chosen": -2.765127658843994,
"logits/rejected": -2.803529739379883,
"logps/chosen": -265.0037841796875,
"logps/rejected": -221.8296661376953,
"loss": 0.69,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03228873759508133,
"rewards/margins": 0.007724687457084656,
"rewards/rejected": 0.024564048275351524,
"step": 5130
},
{
"epoch": 0.9,
"learning_rate": 7.486146095717883e-08,
"logits/chosen": -2.739295482635498,
"logits/rejected": -2.737955093383789,
"logps/chosen": -210.24307250976562,
"logps/rejected": -197.39566040039062,
"loss": 0.691,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.01834609918296337,
"rewards/margins": 0.0016159085789695382,
"rewards/rejected": 0.016730191186070442,
"step": 5140
},
{
"epoch": 0.9,
"learning_rate": 7.481108312342569e-08,
"logits/chosen": -2.8013620376586914,
"logits/rejected": -2.766737461090088,
"logps/chosen": -246.08480834960938,
"logps/rejected": -205.478759765625,
"loss": 0.6912,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.024060197174549103,
"rewards/margins": 0.003503562416881323,
"rewards/rejected": 0.020556632429361343,
"step": 5150
},
{
"epoch": 0.9,
"learning_rate": 7.476070528967254e-08,
"logits/chosen": -2.8327503204345703,
"logits/rejected": -2.825082302093506,
"logps/chosen": -218.51394653320312,
"logps/rejected": -197.2113800048828,
"loss": 0.6913,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.025230538100004196,
"rewards/margins": 0.002071975963190198,
"rewards/rejected": 0.023158561438322067,
"step": 5160
},
{
"epoch": 0.91,
"learning_rate": 7.47103274559194e-08,
"logits/chosen": -2.721312999725342,
"logits/rejected": -2.7535860538482666,
"logps/chosen": -210.86325073242188,
"logps/rejected": -202.97125244140625,
"loss": 0.6902,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.01850944198668003,
"rewards/margins": 0.002257524523884058,
"rewards/rejected": 0.01625191606581211,
"step": 5170
},
{
"epoch": 0.91,
"learning_rate": 7.465994962216624e-08,
"logits/chosen": -2.7364120483398438,
"logits/rejected": -2.808478355407715,
"logps/chosen": -236.8877716064453,
"logps/rejected": -233.90103149414062,
"loss": 0.6913,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.02594706416130066,
"rewards/margins": 0.0006133163697086275,
"rewards/rejected": 0.025333750993013382,
"step": 5180
},
{
"epoch": 0.91,
"learning_rate": 7.460957178841309e-08,
"logits/chosen": -2.789334535598755,
"logits/rejected": -2.7878098487854004,
"logps/chosen": -246.96987915039062,
"logps/rejected": -218.8030548095703,
"loss": 0.6911,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02684968151152134,
"rewards/margins": 0.00774233415722847,
"rewards/rejected": 0.019107351079583168,
"step": 5190
},
{
"epoch": 0.91,
"learning_rate": 7.455919395465994e-08,
"logits/chosen": -2.6209568977355957,
"logits/rejected": -2.766512870788574,
"logps/chosen": -260.9529113769531,
"logps/rejected": -207.5177459716797,
"loss": 0.6897,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02858014777302742,
"rewards/margins": 0.006817141082137823,
"rewards/rejected": 0.02176300808787346,
"step": 5200
},
{
"epoch": 0.91,
"learning_rate": 7.45088161209068e-08,
"logits/chosen": -2.7715020179748535,
"logits/rejected": -2.7795920372009277,
"logps/chosen": -250.96273803710938,
"logps/rejected": -235.0276336669922,
"loss": 0.6909,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.027890939265489578,
"rewards/margins": -0.0006950365495868027,
"rewards/rejected": 0.028585975989699364,
"step": 5210
},
{
"epoch": 0.91,
"learning_rate": 7.445843828715365e-08,
"logits/chosen": -2.709684133529663,
"logits/rejected": -2.7793078422546387,
"logps/chosen": -239.56918334960938,
"logps/rejected": -206.3387908935547,
"loss": 0.6904,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.027700409293174744,
"rewards/margins": 0.007622907869517803,
"rewards/rejected": 0.020077500492334366,
"step": 5220
},
{
"epoch": 0.92,
"learning_rate": 7.44080604534005e-08,
"logits/chosen": -2.7601256370544434,
"logits/rejected": -2.716702461242676,
"logps/chosen": -233.1493377685547,
"logps/rejected": -227.4046173095703,
"loss": 0.6898,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.028554772958159447,
"rewards/margins": 0.009560917504131794,
"rewards/rejected": 0.018993858247995377,
"step": 5230
},
{
"epoch": 0.92,
"learning_rate": 7.435768261964736e-08,
"logits/chosen": -2.7953238487243652,
"logits/rejected": -2.7698287963867188,
"logps/chosen": -253.69473266601562,
"logps/rejected": -218.02468872070312,
"loss": 0.6901,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.03720221668481827,
"rewards/margins": 0.011492163874208927,
"rewards/rejected": 0.025710051879286766,
"step": 5240
},
{
"epoch": 0.92,
"learning_rate": 7.43073047858942e-08,
"logits/chosen": -2.7610411643981934,
"logits/rejected": -2.7470200061798096,
"logps/chosen": -214.7230987548828,
"logps/rejected": -183.76800537109375,
"loss": 0.6901,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.02231210097670555,
"rewards/margins": 0.00498523935675621,
"rewards/rejected": 0.01732686348259449,
"step": 5250
},
{
"epoch": 0.92,
"learning_rate": 7.425692695214105e-08,
"logits/chosen": -2.7620432376861572,
"logits/rejected": -2.724316358566284,
"logps/chosen": -206.0223388671875,
"logps/rejected": -204.09695434570312,
"loss": 0.6909,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.021319400519132614,
"rewards/margins": 0.007719547487795353,
"rewards/rejected": 0.01359985489398241,
"step": 5260
},
{
"epoch": 0.92,
"learning_rate": 7.42065491183879e-08,
"logits/chosen": -2.7803006172180176,
"logits/rejected": -2.7820000648498535,
"logps/chosen": -175.95228576660156,
"logps/rejected": -147.31631469726562,
"loss": 0.6906,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.01864704303443432,
"rewards/margins": 0.005782184191048145,
"rewards/rejected": 0.012864859774708748,
"step": 5270
},
{
"epoch": 0.92,
"learning_rate": 7.415617128463476e-08,
"logits/chosen": -2.7566115856170654,
"logits/rejected": -2.7493796348571777,
"logps/chosen": -277.02899169921875,
"logps/rejected": -236.46224975585938,
"loss": 0.6905,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": 0.037890736013650894,
"rewards/margins": 0.00899316743016243,
"rewards/rejected": 0.028897572308778763,
"step": 5280
},
{
"epoch": 0.93,
"learning_rate": 7.41057934508816e-08,
"logits/chosen": -2.733806610107422,
"logits/rejected": -2.809513807296753,
"logps/chosen": -249.7975311279297,
"logps/rejected": -216.98861694335938,
"loss": 0.6891,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02854977548122406,
"rewards/margins": 0.007073344197124243,
"rewards/rejected": 0.021476436406373978,
"step": 5290
},
{
"epoch": 0.93,
"learning_rate": 7.405541561712845e-08,
"logits/chosen": -2.793487071990967,
"logits/rejected": -2.745420217514038,
"logps/chosen": -219.4196319580078,
"logps/rejected": -186.6765594482422,
"loss": 0.6899,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.023922424763441086,
"rewards/margins": 0.007303243037313223,
"rewards/rejected": 0.016619181260466576,
"step": 5300
},
{
"epoch": 0.93,
"learning_rate": 7.40050377833753e-08,
"logits/chosen": -2.798801898956299,
"logits/rejected": -2.8438451290130615,
"logps/chosen": -214.73941040039062,
"logps/rejected": -186.37538146972656,
"loss": 0.6908,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.02055622637271881,
"rewards/margins": 0.003379581030458212,
"rewards/rejected": 0.017176643013954163,
"step": 5310
},
{
"epoch": 0.93,
"learning_rate": 7.395465994962217e-08,
"logits/chosen": -2.7654082775115967,
"logits/rejected": -2.7806427478790283,
"logps/chosen": -219.7326202392578,
"logps/rejected": -204.74957275390625,
"loss": 0.6899,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.02500101923942566,
"rewards/margins": 0.0017423263052478433,
"rewards/rejected": 0.023258691653609276,
"step": 5320
},
{
"epoch": 0.93,
"learning_rate": 7.390428211586901e-08,
"logits/chosen": -2.636276960372925,
"logits/rejected": -2.816444158554077,
"logps/chosen": -206.4623565673828,
"logps/rejected": -154.90005493164062,
"loss": 0.6904,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.02116440422832966,
"rewards/margins": 0.004634098149836063,
"rewards/rejected": 0.01653030514717102,
"step": 5330
},
{
"epoch": 0.94,
"learning_rate": 7.385390428211587e-08,
"logits/chosen": -2.71712589263916,
"logits/rejected": -2.712641477584839,
"logps/chosen": -234.46609497070312,
"logps/rejected": -188.48818969726562,
"loss": 0.6926,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.020298270508646965,
"rewards/margins": 0.0009019045392051339,
"rewards/rejected": 0.01939636841416359,
"step": 5340
},
{
"epoch": 0.94,
"learning_rate": 7.380352644836272e-08,
"logits/chosen": -2.813690662384033,
"logits/rejected": -2.7450575828552246,
"logps/chosen": -229.24288940429688,
"logps/rejected": -251.2069549560547,
"loss": 0.6904,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.02722129225730896,
"rewards/margins": -0.0024374243803322315,
"rewards/rejected": 0.029658714309334755,
"step": 5350
},
{
"epoch": 0.94,
"learning_rate": 7.375314861460957e-08,
"logits/chosen": -2.7050914764404297,
"logits/rejected": -2.6738526821136475,
"logps/chosen": -209.76651000976562,
"logps/rejected": -210.8341064453125,
"loss": 0.6913,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.018942106515169144,
"rewards/margins": -0.0005925153382122517,
"rewards/rejected": 0.019534621387720108,
"step": 5360
},
{
"epoch": 0.94,
"learning_rate": 7.370277078085641e-08,
"logits/chosen": -2.723813533782959,
"logits/rejected": -2.7255825996398926,
"logps/chosen": -245.219482421875,
"logps/rejected": -260.9398498535156,
"loss": 0.6912,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.02663588896393776,
"rewards/margins": -0.0023054510820657015,
"rewards/rejected": 0.02894134260714054,
"step": 5370
},
{
"epoch": 0.94,
"learning_rate": 7.365239294710327e-08,
"logits/chosen": -2.768441677093506,
"logits/rejected": -2.7272372245788574,
"logps/chosen": -226.75308227539062,
"logps/rejected": -202.91358947753906,
"loss": 0.6912,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.026924926787614822,
"rewards/margins": 0.00796701293438673,
"rewards/rejected": 0.018957912921905518,
"step": 5380
},
{
"epoch": 0.94,
"learning_rate": 7.360201511335012e-08,
"logits/chosen": -2.7350900173187256,
"logits/rejected": -2.7533819675445557,
"logps/chosen": -191.90249633789062,
"logps/rejected": -169.1590118408203,
"loss": 0.6904,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.018432730808854103,
"rewards/margins": 0.006261094473302364,
"rewards/rejected": 0.012171637266874313,
"step": 5390
},
{
"epoch": 0.95,
"learning_rate": 7.355163727959698e-08,
"logits/chosen": -2.700066089630127,
"logits/rejected": -2.7570040225982666,
"logps/chosen": -263.6595153808594,
"logps/rejected": -196.6237335205078,
"loss": 0.6895,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.030814606696367264,
"rewards/margins": 0.012204675003886223,
"rewards/rejected": 0.01860993169248104,
"step": 5400
},
{
"epoch": 0.95,
"learning_rate": 7.350125944584382e-08,
"logits/chosen": -2.8282995223999023,
"logits/rejected": -2.7629384994506836,
"logps/chosen": -218.19076538085938,
"logps/rejected": -225.69961547851562,
"loss": 0.6907,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.025148767977952957,
"rewards/margins": 0.0035461492370814085,
"rewards/rejected": 0.02160261943936348,
"step": 5410
},
{
"epoch": 0.95,
"learning_rate": 7.345088161209067e-08,
"logits/chosen": -2.7315096855163574,
"logits/rejected": -2.767759323120117,
"logps/chosen": -221.05850219726562,
"logps/rejected": -205.8386688232422,
"loss": 0.6912,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.025065699592232704,
"rewards/margins": 0.004063331056386232,
"rewards/rejected": 0.02100237086415291,
"step": 5420
},
{
"epoch": 0.95,
"learning_rate": 7.340050377833754e-08,
"logits/chosen": -2.754154682159424,
"logits/rejected": -2.780801296234131,
"logps/chosen": -197.50173950195312,
"logps/rejected": -179.8265380859375,
"loss": 0.6907,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.02420850098133087,
"rewards/margins": 0.010105123743414879,
"rewards/rejected": 0.014103377237915993,
"step": 5430
},
{
"epoch": 0.95,
"learning_rate": 7.335012594458439e-08,
"logits/chosen": -2.699470043182373,
"logits/rejected": -2.740807294845581,
"logps/chosen": -234.15097045898438,
"logps/rejected": -194.5983428955078,
"loss": 0.6902,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.02444395422935486,
"rewards/margins": 0.007107601501047611,
"rewards/rejected": 0.017336349934339523,
"step": 5440
},
{
"epoch": 0.95,
"learning_rate": 7.329974811083123e-08,
"logits/chosen": -2.7896604537963867,
"logits/rejected": -2.846015214920044,
"logps/chosen": -242.762939453125,
"logps/rejected": -184.61318969726562,
"loss": 0.6902,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.02861708402633667,
"rewards/margins": 0.012237682938575745,
"rewards/rejected": 0.016379402950406075,
"step": 5450
},
{
"epoch": 0.96,
"learning_rate": 7.324937027707808e-08,
"logits/chosen": -2.7799696922302246,
"logits/rejected": -2.8197786808013916,
"logps/chosen": -238.2605743408203,
"logps/rejected": -217.13143920898438,
"loss": 0.6904,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.02993357554078102,
"rewards/margins": 0.008179426193237305,
"rewards/rejected": 0.021754145622253418,
"step": 5460
},
{
"epoch": 0.96,
"learning_rate": 7.319899244332494e-08,
"logits/chosen": -2.792241096496582,
"logits/rejected": -2.817352294921875,
"logps/chosen": -229.5667266845703,
"logps/rejected": -233.867431640625,
"loss": 0.6899,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.028801094740629196,
"rewards/margins": 0.0033335580956190825,
"rewards/rejected": 0.025467539206147194,
"step": 5470
},
{
"epoch": 0.96,
"learning_rate": 7.314861460957179e-08,
"logits/chosen": -2.7579219341278076,
"logits/rejected": -2.7147867679595947,
"logps/chosen": -258.652587890625,
"logps/rejected": -257.3244934082031,
"loss": 0.6907,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.02721872553229332,
"rewards/margins": 0.00041804014472290874,
"rewards/rejected": 0.02680068649351597,
"step": 5480
},
{
"epoch": 0.96,
"learning_rate": 7.309823677581863e-08,
"logits/chosen": -2.8154964447021484,
"logits/rejected": -2.8179690837860107,
"logps/chosen": -223.1553192138672,
"logps/rejected": -172.56883239746094,
"loss": 0.6907,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.025681037455797195,
"rewards/margins": 0.011194641701877117,
"rewards/rejected": 0.014486396685242653,
"step": 5490
},
{
"epoch": 0.96,
"learning_rate": 7.304785894206549e-08,
"logits/chosen": -2.7281696796417236,
"logits/rejected": -2.7027804851531982,
"logps/chosen": -190.97433471679688,
"logps/rejected": -182.0121307373047,
"loss": 0.6895,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.023420389741659164,
"rewards/margins": 0.006670433096587658,
"rewards/rejected": 0.01674995757639408,
"step": 5500
},
{
"epoch": 0.97,
"learning_rate": 7.299748110831234e-08,
"logits/chosen": -2.6794257164001465,
"logits/rejected": -2.696403980255127,
"logps/chosen": -214.8280029296875,
"logps/rejected": -171.09063720703125,
"loss": 0.6898,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.026057744398713112,
"rewards/margins": 0.010476592928171158,
"rewards/rejected": 0.015581147745251656,
"step": 5510
},
{
"epoch": 0.97,
"learning_rate": 7.294710327455918e-08,
"logits/chosen": -2.7246193885803223,
"logits/rejected": -2.7311501502990723,
"logps/chosen": -266.88446044921875,
"logps/rejected": -221.1366424560547,
"loss": 0.6903,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.028967270627617836,
"rewards/margins": 0.006662419531494379,
"rewards/rejected": 0.022304847836494446,
"step": 5520
},
{
"epoch": 0.97,
"learning_rate": 7.289672544080603e-08,
"logits/chosen": -2.7876334190368652,
"logits/rejected": -2.8115463256835938,
"logps/chosen": -240.1504669189453,
"logps/rejected": -210.5426788330078,
"loss": 0.69,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.027545759454369545,
"rewards/margins": 0.009936556220054626,
"rewards/rejected": 0.01760920323431492,
"step": 5530
},
{
"epoch": 0.97,
"learning_rate": 7.28463476070529e-08,
"logits/chosen": -2.799808979034424,
"logits/rejected": -2.8136532306671143,
"logps/chosen": -222.64321899414062,
"logps/rejected": -197.42601013183594,
"loss": 0.6918,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.021958649158477783,
"rewards/margins": -0.0008252925472334027,
"rewards/rejected": 0.02278394252061844,
"step": 5540
},
{
"epoch": 0.97,
"learning_rate": 7.279596977329975e-08,
"logits/chosen": -2.6864452362060547,
"logits/rejected": -2.707339286804199,
"logps/chosen": -233.6274871826172,
"logps/rejected": -208.48046875,
"loss": 0.6901,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03295878320932388,
"rewards/margins": 0.011183591559529305,
"rewards/rejected": 0.021775193512439728,
"step": 5550
},
{
"epoch": 0.97,
"learning_rate": 7.27455919395466e-08,
"logits/chosen": -2.8088607788085938,
"logits/rejected": -2.825002431869507,
"logps/chosen": -218.2990264892578,
"logps/rejected": -191.56271362304688,
"loss": 0.6911,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.02727615274488926,
"rewards/margins": 0.0035555907525122166,
"rewards/rejected": 0.02372056432068348,
"step": 5560
},
{
"epoch": 0.98,
"learning_rate": 7.269521410579345e-08,
"logits/chosen": -2.7786643505096436,
"logits/rejected": -2.771984100341797,
"logps/chosen": -216.9097442626953,
"logps/rejected": -186.2939910888672,
"loss": 0.6897,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.023232027888298035,
"rewards/margins": 0.009016161784529686,
"rewards/rejected": 0.014215867035090923,
"step": 5570
},
{
"epoch": 0.98,
"learning_rate": 7.26448362720403e-08,
"logits/chosen": -2.739405393600464,
"logits/rejected": -2.7287230491638184,
"logps/chosen": -203.91127014160156,
"logps/rejected": -170.11453247070312,
"loss": 0.6909,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.020928533747792244,
"rewards/margins": 0.00953659974038601,
"rewards/rejected": 0.011391934007406235,
"step": 5580
},
{
"epoch": 0.98,
"learning_rate": 7.259445843828716e-08,
"logits/chosen": -2.740872383117676,
"logits/rejected": -2.7223007678985596,
"logps/chosen": -233.0533905029297,
"logps/rejected": -194.1956024169922,
"loss": 0.6897,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.030118608847260475,
"rewards/margins": 0.010699293576180935,
"rewards/rejected": 0.019419312477111816,
"step": 5590
},
{
"epoch": 0.98,
"learning_rate": 7.2544080604534e-08,
"logits/chosen": -2.7146565914154053,
"logits/rejected": -2.750152349472046,
"logps/chosen": -256.93853759765625,
"logps/rejected": -221.79159545898438,
"loss": 0.6904,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.02939864620566368,
"rewards/margins": 0.0112245362251997,
"rewards/rejected": 0.01817411556839943,
"step": 5600
},
{
"epoch": 0.98,
"learning_rate": 7.249370277078085e-08,
"logits/chosen": -2.8190269470214844,
"logits/rejected": -2.767198085784912,
"logps/chosen": -229.6221923828125,
"logps/rejected": -172.2571258544922,
"loss": 0.6898,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.028731968253850937,
"rewards/margins": 0.008819608017802238,
"rewards/rejected": 0.019912362098693848,
"step": 5610
},
{
"epoch": 0.98,
"learning_rate": 7.24433249370277e-08,
"logits/chosen": -2.7028396129608154,
"logits/rejected": -2.7214255332946777,
"logps/chosen": -250.2680206298828,
"logps/rejected": -220.27035522460938,
"loss": 0.6902,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.025800978764891624,
"rewards/margins": 0.005141588859260082,
"rewards/rejected": 0.02065938711166382,
"step": 5620
},
{
"epoch": 0.99,
"learning_rate": 7.239294710327456e-08,
"logits/chosen": -2.701507806777954,
"logits/rejected": -2.7152953147888184,
"logps/chosen": -232.4032745361328,
"logps/rejected": -196.23092651367188,
"loss": 0.6896,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.02751338854432106,
"rewards/margins": 0.009677217341959476,
"rewards/rejected": 0.01783617213368416,
"step": 5630
},
{
"epoch": 0.99,
"learning_rate": 7.23425692695214e-08,
"logits/chosen": -2.7169084548950195,
"logits/rejected": -2.7731575965881348,
"logps/chosen": -185.28652954101562,
"logps/rejected": -152.3063507080078,
"loss": 0.6894,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.019060537219047546,
"rewards/margins": 0.005134892649948597,
"rewards/rejected": 0.01392564456909895,
"step": 5640
},
{
"epoch": 0.99,
"learning_rate": 7.229219143576826e-08,
"logits/chosen": -2.6719276905059814,
"logits/rejected": -2.738537549972534,
"logps/chosen": -235.8744354248047,
"logps/rejected": -199.79006958007812,
"loss": 0.6906,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.020635856315493584,
"rewards/margins": 0.0033695294987410307,
"rewards/rejected": 0.017266323789954185,
"step": 5650
},
{
"epoch": 0.99,
"learning_rate": 7.224181360201512e-08,
"logits/chosen": -2.7093288898468018,
"logits/rejected": -2.734323740005493,
"logps/chosen": -250.06448364257812,
"logps/rejected": -218.0438995361328,
"loss": 0.6891,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03046129085123539,
"rewards/margins": 0.009602924808859825,
"rewards/rejected": 0.020858367905020714,
"step": 5660
},
{
"epoch": 0.99,
"learning_rate": 7.219143576826197e-08,
"logits/chosen": -2.734480381011963,
"logits/rejected": -2.7367444038391113,
"logps/chosen": -229.1237030029297,
"logps/rejected": -193.18789672851562,
"loss": 0.6905,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.030041057616472244,
"rewards/margins": 0.01030112337321043,
"rewards/rejected": 0.01973992958664894,
"step": 5670
},
{
"epoch": 0.99,
"learning_rate": 7.214105793450881e-08,
"logits/chosen": -2.8194003105163574,
"logits/rejected": -2.806227922439575,
"logps/chosen": -236.7169647216797,
"logps/rejected": -207.375244140625,
"loss": 0.6903,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03411722555756569,
"rewards/margins": 0.006585100200027227,
"rewards/rejected": 0.027532124891877174,
"step": 5680
},
{
"epoch": 1.0,
"learning_rate": 7.209068010075566e-08,
"logits/chosen": -2.7609643936157227,
"logits/rejected": -2.717151165008545,
"logps/chosen": -202.71209716796875,
"logps/rejected": -206.85635375976562,
"loss": 0.6906,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.021368782967329025,
"rewards/margins": 0.0015123977791517973,
"rewards/rejected": 0.01985638588666916,
"step": 5690
},
{
"epoch": 1.0,
"learning_rate": 7.204030226700252e-08,
"logits/chosen": -2.7241241931915283,
"logits/rejected": -2.7976861000061035,
"logps/chosen": -214.01611328125,
"logps/rejected": -226.95248413085938,
"loss": 0.6895,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.02871261164546013,
"rewards/margins": 0.0027239874470978975,
"rewards/rejected": 0.025988629087805748,
"step": 5700
},
{
"epoch": 1.0,
"learning_rate": 7.198992443324937e-08,
"logits/chosen": -2.7344629764556885,
"logits/rejected": -2.7737178802490234,
"logps/chosen": -182.60733032226562,
"logps/rejected": -152.49124145507812,
"loss": 0.6898,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.017043083906173706,
"rewards/margins": 0.007706266827881336,
"rewards/rejected": 0.00933681707829237,
"step": 5710
},
{
"epoch": 1.0,
"learning_rate": 7.193954659949621e-08,
"logits/chosen": -2.763538360595703,
"logits/rejected": -2.748915195465088,
"logps/chosen": -231.2855224609375,
"logps/rejected": -191.68783569335938,
"loss": 0.6902,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.025866854935884476,
"rewards/margins": 0.006101249251514673,
"rewards/rejected": 0.01976560428738594,
"step": 5720
},
{
"epoch": 1.0,
"learning_rate": 7.188916876574307e-08,
"logits/chosen": -2.7810988426208496,
"logits/rejected": -2.7703845500946045,
"logps/chosen": -244.68374633789062,
"logps/rejected": -209.5547637939453,
"loss": 0.6905,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02857055887579918,
"rewards/margins": 0.007741375360637903,
"rewards/rejected": 0.020829183980822563,
"step": 5730
},
{
"epoch": 1.01,
"learning_rate": 7.183879093198992e-08,
"logits/chosen": -2.7122907638549805,
"logits/rejected": -2.73596453666687,
"logps/chosen": -255.967041015625,
"logps/rejected": -266.4009094238281,
"loss": 0.6912,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.028105050325393677,
"rewards/margins": -0.008025139570236206,
"rewards/rejected": 0.03613018989562988,
"step": 5740
},
{
"epoch": 1.01,
"learning_rate": 7.178841309823677e-08,
"logits/chosen": -2.866520404815674,
"logits/rejected": -2.8223705291748047,
"logps/chosen": -247.6078643798828,
"logps/rejected": -226.6530303955078,
"loss": 0.6899,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.03066597506403923,
"rewards/margins": 0.0038692415691912174,
"rewards/rejected": 0.0267967339605093,
"step": 5750
},
{
"epoch": 1.01,
"learning_rate": 7.173803526448363e-08,
"logits/chosen": -2.6920933723449707,
"logits/rejected": -2.7121245861053467,
"logps/chosen": -215.04800415039062,
"logps/rejected": -174.98876953125,
"loss": 0.6894,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.02779332920908928,
"rewards/margins": 0.01028980128467083,
"rewards/rejected": 0.0175035297870636,
"step": 5760
},
{
"epoch": 1.01,
"learning_rate": 7.168765743073048e-08,
"logits/chosen": -2.8041000366210938,
"logits/rejected": -2.824524164199829,
"logps/chosen": -218.9689483642578,
"logps/rejected": -179.63414001464844,
"loss": 0.6899,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03265921026468277,
"rewards/margins": 0.011257478967308998,
"rewards/rejected": 0.02140173129737377,
"step": 5770
},
{
"epoch": 1.01,
"learning_rate": 7.163727959697733e-08,
"logits/chosen": -2.758688449859619,
"logits/rejected": -2.7820353507995605,
"logps/chosen": -208.04373168945312,
"logps/rejected": -205.10140991210938,
"loss": 0.6901,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.02206188254058361,
"rewards/margins": -0.00437159975990653,
"rewards/rejected": 0.026433482766151428,
"step": 5780
},
{
"epoch": 1.01,
"learning_rate": 7.158690176322419e-08,
"logits/chosen": -2.7041327953338623,
"logits/rejected": -2.728461503982544,
"logps/chosen": -280.71221923828125,
"logps/rejected": -219.6815643310547,
"loss": 0.689,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.03200947865843773,
"rewards/margins": 0.012490824796259403,
"rewards/rejected": 0.019518649205565453,
"step": 5790
},
{
"epoch": 1.02,
"learning_rate": 7.153652392947103e-08,
"logits/chosen": -2.7607803344726562,
"logits/rejected": -2.7257144451141357,
"logps/chosen": -190.4318084716797,
"logps/rejected": -195.79026794433594,
"loss": 0.6905,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.02486034855246544,
"rewards/margins": 0.004990352317690849,
"rewards/rejected": 0.01986999623477459,
"step": 5800
},
{
"epoch": 1.02,
"learning_rate": 7.148614609571788e-08,
"logits/chosen": -2.792731761932373,
"logits/rejected": -2.72947096824646,
"logps/chosen": -285.7711486816406,
"logps/rejected": -224.35043334960938,
"loss": 0.6903,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": 0.038356930017471313,
"rewards/margins": 0.013529865071177483,
"rewards/rejected": 0.02482706308364868,
"step": 5810
},
{
"epoch": 1.02,
"learning_rate": 7.143576826196474e-08,
"logits/chosen": -2.727290630340576,
"logits/rejected": -2.7715020179748535,
"logps/chosen": -213.47970581054688,
"logps/rejected": -171.37945556640625,
"loss": 0.6895,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.029690707102417946,
"rewards/margins": 0.009509574621915817,
"rewards/rejected": 0.02018113061785698,
"step": 5820
},
{
"epoch": 1.02,
"learning_rate": 7.138539042821158e-08,
"logits/chosen": -2.8073341846466064,
"logits/rejected": -2.7381162643432617,
"logps/chosen": -247.31967163085938,
"logps/rejected": -208.36679077148438,
"loss": 0.6895,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.026355374604463577,
"rewards/margins": 0.008763824589550495,
"rewards/rejected": 0.017591550946235657,
"step": 5830
},
{
"epoch": 1.02,
"learning_rate": 7.133501259445843e-08,
"logits/chosen": -2.730480670928955,
"logits/rejected": -2.8047595024108887,
"logps/chosen": -233.4124298095703,
"logps/rejected": -195.85726928710938,
"loss": 0.6887,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.03406389430165291,
"rewards/margins": 0.012370677664875984,
"rewards/rejected": 0.021693218499422073,
"step": 5840
},
{
"epoch": 1.02,
"learning_rate": 7.128463476070528e-08,
"logits/chosen": -2.808271884918213,
"logits/rejected": -2.814162015914917,
"logps/chosen": -236.5506134033203,
"logps/rejected": -254.416748046875,
"loss": 0.6909,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.034293659031391144,
"rewards/margins": -0.00255168997682631,
"rewards/rejected": 0.03684535250067711,
"step": 5850
},
{
"epoch": 1.03,
"learning_rate": 7.123425692695214e-08,
"logits/chosen": -2.7728164196014404,
"logits/rejected": -2.8868014812469482,
"logps/chosen": -273.46490478515625,
"logps/rejected": -276.16217041015625,
"loss": 0.6904,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.032950371503829956,
"rewards/margins": -0.0058128563687205315,
"rewards/rejected": 0.038763221353292465,
"step": 5860
},
{
"epoch": 1.03,
"learning_rate": 7.118387909319899e-08,
"logits/chosen": -2.7602274417877197,
"logits/rejected": -2.7588744163513184,
"logps/chosen": -227.1925048828125,
"logps/rejected": -201.4271240234375,
"loss": 0.69,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.027265915647149086,
"rewards/margins": 0.004671896807849407,
"rewards/rejected": 0.022594016045331955,
"step": 5870
},
{
"epoch": 1.03,
"learning_rate": 7.113350125944584e-08,
"logits/chosen": -2.844517230987549,
"logits/rejected": -2.8165762424468994,
"logps/chosen": -264.95025634765625,
"logps/rejected": -215.6854705810547,
"loss": 0.6902,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03531178832054138,
"rewards/margins": 0.013238337822258472,
"rewards/rejected": 0.022073451429605484,
"step": 5880
},
{
"epoch": 1.03,
"learning_rate": 7.10831234256927e-08,
"logits/chosen": -2.6709351539611816,
"logits/rejected": -2.7894115447998047,
"logps/chosen": -224.2041473388672,
"logps/rejected": -195.13259887695312,
"loss": 0.6913,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.030605291947722435,
"rewards/margins": 0.006223782896995544,
"rewards/rejected": 0.02438150718808174,
"step": 5890
},
{
"epoch": 1.03,
"learning_rate": 7.103274559193955e-08,
"logits/chosen": -2.7667765617370605,
"logits/rejected": -2.8099000453948975,
"logps/chosen": -275.52734375,
"logps/rejected": -254.30813598632812,
"loss": 0.6897,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03211339935660362,
"rewards/margins": 0.007406218443065882,
"rewards/rejected": 0.02470717951655388,
"step": 5900
},
{
"epoch": 1.04,
"learning_rate": 7.098236775818639e-08,
"logits/chosen": -2.7795968055725098,
"logits/rejected": -2.7805514335632324,
"logps/chosen": -233.39816284179688,
"logps/rejected": -226.5900115966797,
"loss": 0.6904,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.032585471868515015,
"rewards/margins": 0.0037678040098398924,
"rewards/rejected": 0.02881767228245735,
"step": 5910
},
{
"epoch": 1.04,
"learning_rate": 7.093198992443325e-08,
"logits/chosen": -2.794847249984741,
"logits/rejected": -2.7636165618896484,
"logps/chosen": -205.1078338623047,
"logps/rejected": -182.61715698242188,
"loss": 0.6898,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.030280139297246933,
"rewards/margins": 0.009688856080174446,
"rewards/rejected": 0.020591281354427338,
"step": 5920
},
{
"epoch": 1.04,
"learning_rate": 7.08816120906801e-08,
"logits/chosen": -2.6991028785705566,
"logits/rejected": -2.7790234088897705,
"logps/chosen": -191.94183349609375,
"logps/rejected": -199.76925659179688,
"loss": 0.691,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.023268550634384155,
"rewards/margins": -0.0027100746519863605,
"rewards/rejected": 0.02597862482070923,
"step": 5930
},
{
"epoch": 1.04,
"learning_rate": 7.083123425692695e-08,
"logits/chosen": -2.7407565116882324,
"logits/rejected": -2.7216477394104004,
"logps/chosen": -215.4610595703125,
"logps/rejected": -210.43701171875,
"loss": 0.691,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.027795767411589622,
"rewards/margins": 0.008198624476790428,
"rewards/rejected": 0.019597141072154045,
"step": 5940
},
{
"epoch": 1.04,
"learning_rate": 7.078085642317379e-08,
"logits/chosen": -2.7855286598205566,
"logits/rejected": -2.8717663288116455,
"logps/chosen": -264.8656005859375,
"logps/rejected": -259.3266906738281,
"loss": 0.6915,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03862554579973221,
"rewards/margins": 0.004008482210338116,
"rewards/rejected": 0.03461706265807152,
"step": 5950
},
{
"epoch": 1.04,
"learning_rate": 7.073047858942065e-08,
"logits/chosen": -2.6747562885284424,
"logits/rejected": -2.7460849285125732,
"logps/chosen": -285.8426513671875,
"logps/rejected": -243.5648193359375,
"loss": 0.6901,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.04209999367594719,
"rewards/margins": 0.006486804690212011,
"rewards/rejected": 0.03561318665742874,
"step": 5960
},
{
"epoch": 1.05,
"learning_rate": 7.06801007556675e-08,
"logits/chosen": -2.763223171234131,
"logits/rejected": -2.7372517585754395,
"logps/chosen": -245.48654174804688,
"logps/rejected": -239.01199340820312,
"loss": 0.6895,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03261946514248848,
"rewards/margins": 0.009107634425163269,
"rewards/rejected": 0.02351183071732521,
"step": 5970
},
{
"epoch": 1.05,
"learning_rate": 7.062972292191435e-08,
"logits/chosen": -2.7299296855926514,
"logits/rejected": -2.765787363052368,
"logps/chosen": -198.8389129638672,
"logps/rejected": -203.43792724609375,
"loss": 0.6911,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.02900700271129608,
"rewards/margins": 0.0003943299816455692,
"rewards/rejected": 0.028612669557332993,
"step": 5980
},
{
"epoch": 1.05,
"learning_rate": 7.057934508816121e-08,
"logits/chosen": -2.7050979137420654,
"logits/rejected": -2.739762544631958,
"logps/chosen": -308.5540466308594,
"logps/rejected": -277.5274658203125,
"loss": 0.6896,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03356204554438591,
"rewards/margins": 0.0038282524328678846,
"rewards/rejected": 0.029733791947364807,
"step": 5990
},
{
"epoch": 1.05,
"learning_rate": 7.052896725440806e-08,
"logits/chosen": -2.6613450050354004,
"logits/rejected": -2.6997017860412598,
"logps/chosen": -219.81979370117188,
"logps/rejected": -204.18075561523438,
"loss": 0.6898,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.029529878869652748,
"rewards/margins": 0.0035093098413199186,
"rewards/rejected": 0.02602056786417961,
"step": 6000
},
{
"epoch": 1.05,
"learning_rate": 7.047858942065492e-08,
"logits/chosen": -2.6856908798217773,
"logits/rejected": -2.740572452545166,
"logps/chosen": -281.0226135253906,
"logps/rejected": -247.1945037841797,
"loss": 0.6903,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03560008853673935,
"rewards/margins": 0.007806276436895132,
"rewards/rejected": 0.02779381349682808,
"step": 6010
},
{
"epoch": 1.05,
"learning_rate": 7.042821158690177e-08,
"logits/chosen": -2.833984851837158,
"logits/rejected": -2.7636830806732178,
"logps/chosen": -253.18115234375,
"logps/rejected": -197.1452178955078,
"loss": 0.6892,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03183367848396301,
"rewards/margins": 0.0074056894518435,
"rewards/rejected": 0.0244279894977808,
"step": 6020
},
{
"epoch": 1.06,
"learning_rate": 7.037783375314861e-08,
"logits/chosen": -2.7777915000915527,
"logits/rejected": -2.8554296493530273,
"logps/chosen": -242.44552612304688,
"logps/rejected": -209.59677124023438,
"loss": 0.6903,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.03452635556459427,
"rewards/margins": 0.002237586071714759,
"rewards/rejected": 0.03228876739740372,
"step": 6030
},
{
"epoch": 1.06,
"learning_rate": 7.032745591939546e-08,
"logits/chosen": -2.7216124534606934,
"logits/rejected": -2.7077813148498535,
"logps/chosen": -227.49072265625,
"logps/rejected": -183.86502075195312,
"loss": 0.6903,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.0319247804582119,
"rewards/margins": 0.00687766820192337,
"rewards/rejected": 0.025047114118933678,
"step": 6040
},
{
"epoch": 1.06,
"learning_rate": 7.027707808564232e-08,
"logits/chosen": -2.730086088180542,
"logits/rejected": -2.7649378776550293,
"logps/chosen": -238.0532989501953,
"logps/rejected": -194.22817993164062,
"loss": 0.6897,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.029018903151154518,
"rewards/margins": 0.002032119780778885,
"rewards/rejected": 0.026986781507730484,
"step": 6050
},
{
"epoch": 1.06,
"learning_rate": 7.022670025188917e-08,
"logits/chosen": -2.7800655364990234,
"logits/rejected": -2.7575435638427734,
"logps/chosen": -224.218017578125,
"logps/rejected": -186.80465698242188,
"loss": 0.69,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.029716094955801964,
"rewards/margins": 0.0046003833413124084,
"rewards/rejected": 0.025115709751844406,
"step": 6060
},
{
"epoch": 1.06,
"learning_rate": 7.017632241813601e-08,
"logits/chosen": -2.7532472610473633,
"logits/rejected": -2.775247573852539,
"logps/chosen": -232.7293701171875,
"logps/rejected": -259.34393310546875,
"loss": 0.69,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.033128730952739716,
"rewards/margins": -0.0032485132105648518,
"rewards/rejected": 0.03637724369764328,
"step": 6070
},
{
"epoch": 1.06,
"learning_rate": 7.012594458438286e-08,
"logits/chosen": -2.722989559173584,
"logits/rejected": -2.778897285461426,
"logps/chosen": -227.8129119873047,
"logps/rejected": -208.2938232421875,
"loss": 0.6896,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.028836023062467575,
"rewards/margins": 0.0021686807740479708,
"rewards/rejected": 0.026667345315217972,
"step": 6080
},
{
"epoch": 1.07,
"learning_rate": 7.007556675062972e-08,
"logits/chosen": -2.8650097846984863,
"logits/rejected": -2.8455333709716797,
"logps/chosen": -229.21517944335938,
"logps/rejected": -196.00250244140625,
"loss": 0.6896,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.032781932502985,
"rewards/margins": 0.013185905292630196,
"rewards/rejected": 0.019596025347709656,
"step": 6090
},
{
"epoch": 1.07,
"learning_rate": 7.002518891687657e-08,
"logits/chosen": -2.674905300140381,
"logits/rejected": -2.693514585494995,
"logps/chosen": -216.5654754638672,
"logps/rejected": -172.6519012451172,
"loss": 0.6906,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.02908332273364067,
"rewards/margins": 0.004312724806368351,
"rewards/rejected": 0.024770598858594894,
"step": 6100
},
{
"epoch": 1.07,
"learning_rate": 6.997481108312342e-08,
"logits/chosen": -2.792025566101074,
"logits/rejected": -2.8154520988464355,
"logps/chosen": -285.5600280761719,
"logps/rejected": -229.28829956054688,
"loss": 0.6898,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.034517981112003326,
"rewards/margins": 0.0033892481587827206,
"rewards/rejected": 0.03112873062491417,
"step": 6110
},
{
"epoch": 1.07,
"learning_rate": 6.992443324937028e-08,
"logits/chosen": -2.7616074085235596,
"logits/rejected": -2.837329864501953,
"logps/chosen": -221.0269317626953,
"logps/rejected": -172.927978515625,
"loss": 0.6897,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.028237927705049515,
"rewards/margins": 0.00989912636578083,
"rewards/rejected": 0.018338803201913834,
"step": 6120
},
{
"epoch": 1.07,
"learning_rate": 6.987405541561713e-08,
"logits/chosen": -2.712308168411255,
"logits/rejected": -2.7479236125946045,
"logps/chosen": -242.038818359375,
"logps/rejected": -203.10403442382812,
"loss": 0.6898,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.032026901841163635,
"rewards/margins": 0.007596462965011597,
"rewards/rejected": 0.02443043515086174,
"step": 6130
},
{
"epoch": 1.08,
"learning_rate": 6.982367758186397e-08,
"logits/chosen": -2.7296433448791504,
"logits/rejected": -2.7758820056915283,
"logps/chosen": -241.84091186523438,
"logps/rejected": -200.144287109375,
"loss": 0.6892,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03152359649538994,
"rewards/margins": 0.009202331304550171,
"rewards/rejected": 0.022321265190839767,
"step": 6140
},
{
"epoch": 1.08,
"learning_rate": 6.977329974811083e-08,
"logits/chosen": -2.761535406112671,
"logits/rejected": -2.720188856124878,
"logps/chosen": -230.50210571289062,
"logps/rejected": -198.60598754882812,
"loss": 0.6898,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.028255242854356766,
"rewards/margins": 0.002794310450553894,
"rewards/rejected": 0.025460928678512573,
"step": 6150
},
{
"epoch": 1.08,
"learning_rate": 6.972292191435768e-08,
"logits/chosen": -2.8285574913024902,
"logits/rejected": -2.7832274436950684,
"logps/chosen": -254.6967315673828,
"logps/rejected": -234.7633056640625,
"loss": 0.6903,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03328879922628403,
"rewards/margins": 0.005169660784304142,
"rewards/rejected": 0.028119131922721863,
"step": 6160
},
{
"epoch": 1.08,
"learning_rate": 6.967254408060453e-08,
"logits/chosen": -2.7056522369384766,
"logits/rejected": -2.7208755016326904,
"logps/chosen": -209.24563598632812,
"logps/rejected": -197.8179473876953,
"loss": 0.6898,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.02616763673722744,
"rewards/margins": 0.004211708437651396,
"rewards/rejected": 0.021955927833914757,
"step": 6170
},
{
"epoch": 1.08,
"learning_rate": 6.962216624685137e-08,
"logits/chosen": -2.662492275238037,
"logits/rejected": -2.671931028366089,
"logps/chosen": -261.2315979003906,
"logps/rejected": -233.17416381835938,
"loss": 0.6897,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.03277582675218582,
"rewards/margins": 0.004679680801928043,
"rewards/rejected": 0.02809615060687065,
"step": 6180
},
{
"epoch": 1.08,
"learning_rate": 6.957178841309823e-08,
"logits/chosen": -2.707197427749634,
"logits/rejected": -2.730229616165161,
"logps/chosen": -252.9608154296875,
"logps/rejected": -213.77774047851562,
"loss": 0.6906,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.036902423948049545,
"rewards/margins": 0.009274457581341267,
"rewards/rejected": 0.027627963572740555,
"step": 6190
},
{
"epoch": 1.09,
"learning_rate": 6.952141057934508e-08,
"logits/chosen": -2.769176959991455,
"logits/rejected": -2.7323288917541504,
"logps/chosen": -218.0635986328125,
"logps/rejected": -207.66445922851562,
"loss": 0.6892,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.026653211563825607,
"rewards/margins": 0.00453142449259758,
"rewards/rejected": 0.022121790796518326,
"step": 6200
},
{
"epoch": 1.09,
"learning_rate": 6.947103274559193e-08,
"logits/chosen": -2.806384325027466,
"logits/rejected": -2.756983518600464,
"logps/chosen": -237.72232055664062,
"logps/rejected": -252.24459838867188,
"loss": 0.6915,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.03373720124363899,
"rewards/margins": -0.0009608466061763465,
"rewards/rejected": 0.03469805419445038,
"step": 6210
},
{
"epoch": 1.09,
"learning_rate": 6.942065491183879e-08,
"logits/chosen": -2.7189059257507324,
"logits/rejected": -2.69968843460083,
"logps/chosen": -186.25367736816406,
"logps/rejected": -182.58639526367188,
"loss": 0.6907,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.02435891702771187,
"rewards/margins": 0.0031697209924459457,
"rewards/rejected": 0.021189197897911072,
"step": 6220
},
{
"epoch": 1.09,
"learning_rate": 6.937027707808564e-08,
"logits/chosen": -2.82783579826355,
"logits/rejected": -2.7836272716522217,
"logps/chosen": -247.9126739501953,
"logps/rejected": -207.5823974609375,
"loss": 0.6892,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.03497808799147606,
"rewards/margins": 0.012263385578989983,
"rewards/rejected": 0.022714700549840927,
"step": 6230
},
{
"epoch": 1.09,
"learning_rate": 6.93198992443325e-08,
"logits/chosen": -2.6979732513427734,
"logits/rejected": -2.7468159198760986,
"logps/chosen": -195.87741088867188,
"logps/rejected": -199.96136474609375,
"loss": 0.6895,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.027930688112974167,
"rewards/margins": -0.0017716297879815102,
"rewards/rejected": 0.0297023206949234,
"step": 6240
},
{
"epoch": 1.09,
"learning_rate": 6.926952141057935e-08,
"logits/chosen": -2.757378101348877,
"logits/rejected": -2.8484787940979004,
"logps/chosen": -252.18197631835938,
"logps/rejected": -213.80307006835938,
"loss": 0.6905,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.032926805317401886,
"rewards/margins": 0.007040529511868954,
"rewards/rejected": 0.025886276736855507,
"step": 6250
},
{
"epoch": 1.1,
"learning_rate": 6.921914357682619e-08,
"logits/chosen": -2.7444984912872314,
"logits/rejected": -2.7312824726104736,
"logps/chosen": -244.59176635742188,
"logps/rejected": -209.32861328125,
"loss": 0.6902,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03717253729701042,
"rewards/margins": 0.011591591872274876,
"rewards/rejected": 0.02558094635605812,
"step": 6260
},
{
"epoch": 1.1,
"learning_rate": 6.916876574307304e-08,
"logits/chosen": -2.8128814697265625,
"logits/rejected": -2.7963852882385254,
"logps/chosen": -273.450927734375,
"logps/rejected": -212.9509735107422,
"loss": 0.69,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.037680648267269135,
"rewards/margins": 0.013447249308228493,
"rewards/rejected": 0.024233397096395493,
"step": 6270
},
{
"epoch": 1.1,
"learning_rate": 6.91183879093199e-08,
"logits/chosen": -2.8444695472717285,
"logits/rejected": -2.833711862564087,
"logps/chosen": -237.81787109375,
"logps/rejected": -202.39505004882812,
"loss": 0.6896,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03637075051665306,
"rewards/margins": 0.012740323320031166,
"rewards/rejected": 0.023630429059267044,
"step": 6280
},
{
"epoch": 1.1,
"learning_rate": 6.906801007556675e-08,
"logits/chosen": -2.8796963691711426,
"logits/rejected": -2.8374648094177246,
"logps/chosen": -218.6466064453125,
"logps/rejected": -233.56826782226562,
"loss": 0.6893,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.027191419154405594,
"rewards/margins": -0.00017332080460619181,
"rewards/rejected": 0.027364740148186684,
"step": 6290
},
{
"epoch": 1.1,
"learning_rate": 6.901763224181359e-08,
"logits/chosen": -2.7870595455169678,
"logits/rejected": -2.726167678833008,
"logps/chosen": -234.41732788085938,
"logps/rejected": -195.29246520996094,
"loss": 0.6901,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.032856278121471405,
"rewards/margins": 0.009746129624545574,
"rewards/rejected": 0.023110145702958107,
"step": 6300
},
{
"epoch": 1.11,
"learning_rate": 6.896725440806044e-08,
"logits/chosen": -2.7080512046813965,
"logits/rejected": -2.6986517906188965,
"logps/chosen": -214.7272491455078,
"logps/rejected": -181.70693969726562,
"loss": 0.6897,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.028171220794320107,
"rewards/margins": 0.008141187019646168,
"rewards/rejected": 0.020030032843351364,
"step": 6310
},
{
"epoch": 1.11,
"learning_rate": 6.89168765743073e-08,
"logits/chosen": -2.8024163246154785,
"logits/rejected": -2.761427164077759,
"logps/chosen": -221.8937530517578,
"logps/rejected": -207.2194366455078,
"loss": 0.6912,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.02579706907272339,
"rewards/margins": 0.005380997434258461,
"rewards/rejected": 0.02041606977581978,
"step": 6320
},
{
"epoch": 1.11,
"learning_rate": 6.886649874055415e-08,
"logits/chosen": -2.7723660469055176,
"logits/rejected": -2.7853739261627197,
"logps/chosen": -264.2718811035156,
"logps/rejected": -234.5113067626953,
"loss": 0.6895,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03535057231783867,
"rewards/margins": 0.0035186149179935455,
"rewards/rejected": 0.03183195739984512,
"step": 6330
},
{
"epoch": 1.11,
"learning_rate": 6.8816120906801e-08,
"logits/chosen": -2.703395366668701,
"logits/rejected": -2.809828519821167,
"logps/chosen": -301.8238525390625,
"logps/rejected": -219.3530731201172,
"loss": 0.6898,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0384126715362072,
"rewards/margins": 0.007866952568292618,
"rewards/rejected": 0.03054572269320488,
"step": 6340
},
{
"epoch": 1.11,
"learning_rate": 6.876574307304786e-08,
"logits/chosen": -2.8216795921325684,
"logits/rejected": -2.800515651702881,
"logps/chosen": -247.65792846679688,
"logps/rejected": -247.12326049804688,
"loss": 0.6906,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.03470718860626221,
"rewards/margins": 0.0031642660032957792,
"rewards/rejected": 0.03154291957616806,
"step": 6350
},
{
"epoch": 1.11,
"learning_rate": 6.871536523929471e-08,
"logits/chosen": -2.7862982749938965,
"logits/rejected": -2.735156297683716,
"logps/chosen": -187.41934204101562,
"logps/rejected": -175.93814086914062,
"loss": 0.6894,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02837715670466423,
"rewards/margins": 0.007649431936442852,
"rewards/rejected": 0.020727727562189102,
"step": 6360
},
{
"epoch": 1.12,
"learning_rate": 6.866498740554157e-08,
"logits/chosen": -2.718940258026123,
"logits/rejected": -2.647468090057373,
"logps/chosen": -211.13345336914062,
"logps/rejected": -231.8296356201172,
"loss": 0.6903,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.027587344869971275,
"rewards/margins": 0.00827721692621708,
"rewards/rejected": 0.019310127943754196,
"step": 6370
},
{
"epoch": 1.12,
"learning_rate": 6.861460957178841e-08,
"logits/chosen": -2.73569917678833,
"logits/rejected": -2.6965410709381104,
"logps/chosen": -213.14785766601562,
"logps/rejected": -239.1310577392578,
"loss": 0.6904,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.033782411366701126,
"rewards/margins": 0.004613696597516537,
"rewards/rejected": 0.029168713837862015,
"step": 6380
},
{
"epoch": 1.12,
"learning_rate": 6.856423173803526e-08,
"logits/chosen": -2.781935691833496,
"logits/rejected": -2.749058246612549,
"logps/chosen": -212.47116088867188,
"logps/rejected": -164.14442443847656,
"loss": 0.6896,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.02552088536322117,
"rewards/margins": 0.009579035453498363,
"rewards/rejected": 0.01594184711575508,
"step": 6390
},
{
"epoch": 1.12,
"learning_rate": 6.851385390428211e-08,
"logits/chosen": -2.7572851181030273,
"logits/rejected": -2.7509846687316895,
"logps/chosen": -216.94027709960938,
"logps/rejected": -181.42041015625,
"loss": 0.688,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02696484699845314,
"rewards/margins": 0.009268132969737053,
"rewards/rejected": 0.017696712166070938,
"step": 6400
},
{
"epoch": 1.12,
"learning_rate": 6.846347607052897e-08,
"logits/chosen": -2.7396633625030518,
"logits/rejected": -2.7270400524139404,
"logps/chosen": -205.31503295898438,
"logps/rejected": -208.9713134765625,
"loss": 0.6897,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.027754198759794235,
"rewards/margins": 0.00899929367005825,
"rewards/rejected": 0.018754903227090836,
"step": 6410
},
{
"epoch": 1.12,
"learning_rate": 6.841309823677581e-08,
"logits/chosen": -2.7138712406158447,
"logits/rejected": -2.6797842979431152,
"logps/chosen": -195.82118225097656,
"logps/rejected": -187.37338256835938,
"loss": 0.6902,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.024918612092733383,
"rewards/margins": 0.0022410769015550613,
"rewards/rejected": 0.022677535191178322,
"step": 6420
},
{
"epoch": 1.13,
"learning_rate": 6.836272040302266e-08,
"logits/chosen": -2.751479387283325,
"logits/rejected": -2.7326974868774414,
"logps/chosen": -228.85043334960938,
"logps/rejected": -207.35287475585938,
"loss": 0.6904,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.033883582800626755,
"rewards/margins": 0.0020071747712790966,
"rewards/rejected": 0.03187640756368637,
"step": 6430
},
{
"epoch": 1.13,
"learning_rate": 6.831234256926952e-08,
"logits/chosen": -2.7368900775909424,
"logits/rejected": -2.7022595405578613,
"logps/chosen": -234.35888671875,
"logps/rejected": -216.0355682373047,
"loss": 0.6898,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03236772492527962,
"rewards/margins": 0.006880121771246195,
"rewards/rejected": 0.02548760175704956,
"step": 6440
},
{
"epoch": 1.13,
"learning_rate": 6.826196473551637e-08,
"logits/chosen": -2.8036484718322754,
"logits/rejected": -2.8090319633483887,
"logps/chosen": -221.8217010498047,
"logps/rejected": -197.96914672851562,
"loss": 0.6894,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.03676612302660942,
"rewards/margins": 0.00784066691994667,
"rewards/rejected": 0.0289254579693079,
"step": 6450
},
{
"epoch": 1.13,
"learning_rate": 6.821158690176322e-08,
"logits/chosen": -2.7491366863250732,
"logits/rejected": -2.7955727577209473,
"logps/chosen": -246.05380249023438,
"logps/rejected": -199.51351928710938,
"loss": 0.6887,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.03833184391260147,
"rewards/margins": 0.010535829700529575,
"rewards/rejected": 0.02779601886868477,
"step": 6460
},
{
"epoch": 1.13,
"learning_rate": 6.816120906801008e-08,
"logits/chosen": -2.7315986156463623,
"logits/rejected": -2.788578987121582,
"logps/chosen": -293.5569763183594,
"logps/rejected": -195.04043579101562,
"loss": 0.689,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.041501227766275406,
"rewards/margins": 0.01331830583512783,
"rewards/rejected": 0.028182918205857277,
"step": 6470
},
{
"epoch": 1.14,
"learning_rate": 6.811083123425693e-08,
"logits/chosen": -2.735344409942627,
"logits/rejected": -2.812255859375,
"logps/chosen": -218.69607543945312,
"logps/rejected": -176.1515350341797,
"loss": 0.6888,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.029728304594755173,
"rewards/margins": 0.007465772330760956,
"rewards/rejected": 0.022262532263994217,
"step": 6480
},
{
"epoch": 1.14,
"learning_rate": 6.806045340050377e-08,
"logits/chosen": -2.7940878868103027,
"logits/rejected": -2.7996413707733154,
"logps/chosen": -222.28524780273438,
"logps/rejected": -160.18359375,
"loss": 0.6886,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03442731127142906,
"rewards/margins": 0.01763591542840004,
"rewards/rejected": 0.01679139956831932,
"step": 6490
},
{
"epoch": 1.14,
"learning_rate": 6.801007556675062e-08,
"logits/chosen": -2.800783157348633,
"logits/rejected": -2.8015666007995605,
"logps/chosen": -258.265625,
"logps/rejected": -225.9890594482422,
"loss": 0.6912,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.027882227674126625,
"rewards/margins": -0.0033497277181595564,
"rewards/rejected": 0.03123195841908455,
"step": 6500
},
{
"epoch": 1.14,
"learning_rate": 6.795969773299748e-08,
"logits/chosen": -2.7174441814422607,
"logits/rejected": -2.72218656539917,
"logps/chosen": -224.7734832763672,
"logps/rejected": -211.9218292236328,
"loss": 0.6896,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.030056113377213478,
"rewards/margins": 0.001766999950632453,
"rewards/rejected": 0.02828911505639553,
"step": 6510
},
{
"epoch": 1.14,
"learning_rate": 6.790931989924433e-08,
"logits/chosen": -2.7325847148895264,
"logits/rejected": -2.677220582962036,
"logps/chosen": -209.3241729736328,
"logps/rejected": -201.1617889404297,
"loss": 0.6901,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.03640920668840408,
"rewards/margins": 0.004497000481933355,
"rewards/rejected": 0.03191220760345459,
"step": 6520
},
{
"epoch": 1.14,
"learning_rate": 6.785894206549117e-08,
"logits/chosen": -2.7233242988586426,
"logits/rejected": -2.754073143005371,
"logps/chosen": -261.9200439453125,
"logps/rejected": -231.17337036132812,
"loss": 0.6898,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.033219657838344574,
"rewards/margins": 0.005315340589731932,
"rewards/rejected": 0.027904313057661057,
"step": 6530
},
{
"epoch": 1.15,
"learning_rate": 6.780856423173803e-08,
"logits/chosen": -2.76570463180542,
"logits/rejected": -2.751070022583008,
"logps/chosen": -222.1561279296875,
"logps/rejected": -208.1566162109375,
"loss": 0.6888,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.03213818743824959,
"rewards/margins": 0.011885440908372402,
"rewards/rejected": 0.02025274559855461,
"step": 6540
},
{
"epoch": 1.15,
"learning_rate": 6.775818639798488e-08,
"logits/chosen": -2.7724246978759766,
"logits/rejected": -2.75826358795166,
"logps/chosen": -221.2061767578125,
"logps/rejected": -196.8527069091797,
"loss": 0.6906,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03563159704208374,
"rewards/margins": 0.00219206721521914,
"rewards/rejected": 0.03343953564763069,
"step": 6550
},
{
"epoch": 1.15,
"learning_rate": 6.770780856423173e-08,
"logits/chosen": -2.753361225128174,
"logits/rejected": -2.754962921142578,
"logps/chosen": -238.34725952148438,
"logps/rejected": -216.7457733154297,
"loss": 0.6886,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.036745570600032806,
"rewards/margins": 0.006122713442891836,
"rewards/rejected": 0.030622858554124832,
"step": 6560
},
{
"epoch": 1.15,
"learning_rate": 6.765743073047859e-08,
"logits/chosen": -2.726283550262451,
"logits/rejected": -2.680886745452881,
"logps/chosen": -244.8686065673828,
"logps/rejected": -183.89035034179688,
"loss": 0.6879,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.03608755022287369,
"rewards/margins": 0.011775456368923187,
"rewards/rejected": 0.0243120975792408,
"step": 6570
},
{
"epoch": 1.15,
"learning_rate": 6.760705289672544e-08,
"logits/chosen": -2.6707301139831543,
"logits/rejected": -2.8088834285736084,
"logps/chosen": -267.09796142578125,
"logps/rejected": -217.032958984375,
"loss": 0.6887,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03969926759600639,
"rewards/margins": 0.006029042415320873,
"rewards/rejected": 0.033670224249362946,
"step": 6580
},
{
"epoch": 1.15,
"learning_rate": 6.75566750629723e-08,
"logits/chosen": -2.808931827545166,
"logits/rejected": -2.7902331352233887,
"logps/chosen": -247.80078125,
"logps/rejected": -202.20140075683594,
"loss": 0.6901,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03151538223028183,
"rewards/margins": 0.003934096544981003,
"rewards/rejected": 0.027581283822655678,
"step": 6590
},
{
"epoch": 1.16,
"learning_rate": 6.750629722921915e-08,
"logits/chosen": -2.787019968032837,
"logits/rejected": -2.751845359802246,
"logps/chosen": -209.40011596679688,
"logps/rejected": -177.8138885498047,
"loss": 0.6893,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.025737786665558815,
"rewards/margins": 0.008292414247989655,
"rewards/rejected": 0.01744537055492401,
"step": 6600
},
{
"epoch": 1.16,
"learning_rate": 6.745591939546599e-08,
"logits/chosen": -2.734375476837158,
"logits/rejected": -2.83819842338562,
"logps/chosen": -279.52569580078125,
"logps/rejected": -200.38143920898438,
"loss": 0.689,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.045416612178087234,
"rewards/margins": 0.015584426000714302,
"rewards/rejected": 0.02983218990266323,
"step": 6610
},
{
"epoch": 1.16,
"learning_rate": 6.740554156171284e-08,
"logits/chosen": -2.7101967334747314,
"logits/rejected": -2.7053380012512207,
"logps/chosen": -208.09811401367188,
"logps/rejected": -186.99386596679688,
"loss": 0.6893,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03134473040699959,
"rewards/margins": 0.013868039473891258,
"rewards/rejected": 0.01747668907046318,
"step": 6620
},
{
"epoch": 1.16,
"learning_rate": 6.73551637279597e-08,
"logits/chosen": -2.791965961456299,
"logits/rejected": -2.7837865352630615,
"logps/chosen": -208.32333374023438,
"logps/rejected": -211.68014526367188,
"loss": 0.6906,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.02462940290570259,
"rewards/margins": 0.0018524207407608628,
"rewards/rejected": 0.022776981815695763,
"step": 6630
},
{
"epoch": 1.16,
"learning_rate": 6.730478589420655e-08,
"logits/chosen": -2.769686222076416,
"logits/rejected": -2.740999937057495,
"logps/chosen": -241.9813690185547,
"logps/rejected": -229.87850952148438,
"loss": 0.6885,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.03970779478549957,
"rewards/margins": 0.005852693226188421,
"rewards/rejected": 0.03385510295629501,
"step": 6640
},
{
"epoch": 1.16,
"learning_rate": 6.725440806045339e-08,
"logits/chosen": -2.763948440551758,
"logits/rejected": -2.793121814727783,
"logps/chosen": -297.51629638671875,
"logps/rejected": -206.64999389648438,
"loss": 0.6892,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.04574600234627724,
"rewards/margins": 0.01908976212143898,
"rewards/rejected": 0.02665623463690281,
"step": 6650
},
{
"epoch": 1.17,
"learning_rate": 6.720403022670024e-08,
"logits/chosen": -2.7918996810913086,
"logits/rejected": -2.747771978378296,
"logps/chosen": -217.94424438476562,
"logps/rejected": -168.6347198486328,
"loss": 0.6898,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.02763747237622738,
"rewards/margins": 0.00968779344111681,
"rewards/rejected": 0.017949678003787994,
"step": 6660
},
{
"epoch": 1.17,
"learning_rate": 6.71536523929471e-08,
"logits/chosen": -2.796182155609131,
"logits/rejected": -2.7847232818603516,
"logps/chosen": -263.08062744140625,
"logps/rejected": -272.1901550292969,
"loss": 0.6905,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.036897528916597366,
"rewards/margins": 0.00214485265314579,
"rewards/rejected": 0.034752678126096725,
"step": 6670
},
{
"epoch": 1.17,
"learning_rate": 6.710327455919395e-08,
"logits/chosen": -2.7384700775146484,
"logits/rejected": -2.7586898803710938,
"logps/chosen": -263.4530029296875,
"logps/rejected": -232.83840942382812,
"loss": 0.6897,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.035116128623485565,
"rewards/margins": 0.007391026709228754,
"rewards/rejected": 0.027725106105208397,
"step": 6680
},
{
"epoch": 1.17,
"learning_rate": 6.70528967254408e-08,
"logits/chosen": -2.75610089302063,
"logits/rejected": -2.781942367553711,
"logps/chosen": -215.61819458007812,
"logps/rejected": -199.6807098388672,
"loss": 0.6886,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.028895875439047813,
"rewards/margins": -0.0010175227653235197,
"rewards/rejected": 0.02991339936852455,
"step": 6690
},
{
"epoch": 1.17,
"learning_rate": 6.700251889168766e-08,
"logits/chosen": -2.722428798675537,
"logits/rejected": -2.7623000144958496,
"logps/chosen": -260.5478210449219,
"logps/rejected": -204.60206604003906,
"loss": 0.6896,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.04780068248510361,
"rewards/margins": 0.013338456861674786,
"rewards/rejected": 0.03446222469210625,
"step": 6700
},
{
"epoch": 1.18,
"learning_rate": 6.695214105793451e-08,
"logits/chosen": -2.8044791221618652,
"logits/rejected": -2.7793936729431152,
"logps/chosen": -286.1170959472656,
"logps/rejected": -230.1556396484375,
"loss": 0.6905,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.043489281088113785,
"rewards/margins": 0.013985136523842812,
"rewards/rejected": 0.029504140838980675,
"step": 6710
},
{
"epoch": 1.18,
"learning_rate": 6.690176322418136e-08,
"logits/chosen": -2.701599597930908,
"logits/rejected": -2.7080159187316895,
"logps/chosen": -230.49649047851562,
"logps/rejected": -155.5298309326172,
"loss": 0.6887,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.034238483756780624,
"rewards/margins": 0.015169240534305573,
"rewards/rejected": 0.0190692450851202,
"step": 6720
},
{
"epoch": 1.18,
"learning_rate": 6.68513853904282e-08,
"logits/chosen": -2.689814329147339,
"logits/rejected": -2.642368793487549,
"logps/chosen": -195.3006134033203,
"logps/rejected": -173.03106689453125,
"loss": 0.6876,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.029249629005789757,
"rewards/margins": 0.012950867414474487,
"rewards/rejected": 0.01629875972867012,
"step": 6730
},
{
"epoch": 1.18,
"learning_rate": 6.680100755667506e-08,
"logits/chosen": -2.7278635501861572,
"logits/rejected": -2.732556104660034,
"logps/chosen": -243.13375854492188,
"logps/rejected": -198.23207092285156,
"loss": 0.6898,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.03910071402788162,
"rewards/margins": 0.012855380773544312,
"rewards/rejected": 0.02624533139169216,
"step": 6740
},
{
"epoch": 1.18,
"learning_rate": 6.675062972292191e-08,
"logits/chosen": -2.7523670196533203,
"logits/rejected": -2.750101089477539,
"logps/chosen": -240.2274627685547,
"logps/rejected": -221.08053588867188,
"loss": 0.6893,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.040501974523067474,
"rewards/margins": 0.01037162821739912,
"rewards/rejected": 0.030130350962281227,
"step": 6750
},
{
"epoch": 1.18,
"learning_rate": 6.670025188916877e-08,
"logits/chosen": -2.802891254425049,
"logits/rejected": -2.7591326236724854,
"logps/chosen": -266.6939697265625,
"logps/rejected": -221.074462890625,
"loss": 0.6898,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.037126895040273666,
"rewards/margins": 0.00036938933772034943,
"rewards/rejected": 0.03675750270485878,
"step": 6760
},
{
"epoch": 1.19,
"learning_rate": 6.66498740554156e-08,
"logits/chosen": -2.8116838932037354,
"logits/rejected": -2.735592842102051,
"logps/chosen": -245.67007446289062,
"logps/rejected": -214.1964569091797,
"loss": 0.6882,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0364735908806324,
"rewards/margins": 0.009604789316654205,
"rewards/rejected": 0.026868799701333046,
"step": 6770
},
{
"epoch": 1.19,
"learning_rate": 6.659949622166246e-08,
"logits/chosen": -2.8009650707244873,
"logits/rejected": -2.7831168174743652,
"logps/chosen": -213.4352569580078,
"logps/rejected": -164.82901000976562,
"loss": 0.6883,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.02785235084593296,
"rewards/margins": 0.01253105141222477,
"rewards/rejected": 0.01532130129635334,
"step": 6780
},
{
"epoch": 1.19,
"learning_rate": 6.654911838790931e-08,
"logits/chosen": -2.6899755001068115,
"logits/rejected": -2.7289154529571533,
"logps/chosen": -199.33334350585938,
"logps/rejected": -205.575439453125,
"loss": 0.6909,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.03206375241279602,
"rewards/margins": 0.001432869117707014,
"rewards/rejected": 0.03063088282942772,
"step": 6790
},
{
"epoch": 1.19,
"learning_rate": 6.649874055415617e-08,
"logits/chosen": -2.6635406017303467,
"logits/rejected": -2.7157580852508545,
"logps/chosen": -196.7146453857422,
"logps/rejected": -176.63833618164062,
"loss": 0.6903,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.031799446791410446,
"rewards/margins": 0.008729107677936554,
"rewards/rejected": 0.02307034283876419,
"step": 6800
},
{
"epoch": 1.19,
"learning_rate": 6.644836272040302e-08,
"logits/chosen": -2.8116531372070312,
"logits/rejected": -2.779773235321045,
"logps/chosen": -196.38583374023438,
"logps/rejected": -194.5372314453125,
"loss": 0.6897,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03152305632829666,
"rewards/margins": 0.006186535116285086,
"rewards/rejected": 0.02533651888370514,
"step": 6810
},
{
"epoch": 1.19,
"learning_rate": 6.639798488664987e-08,
"logits/chosen": -2.771275043487549,
"logits/rejected": -2.77402925491333,
"logps/chosen": -235.0574493408203,
"logps/rejected": -201.66380310058594,
"loss": 0.6903,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.040426142513751984,
"rewards/margins": 0.007161187473684549,
"rewards/rejected": 0.033264946192502975,
"step": 6820
},
{
"epoch": 1.2,
"learning_rate": 6.634760705289673e-08,
"logits/chosen": -2.8188562393188477,
"logits/rejected": -2.7583014965057373,
"logps/chosen": -241.53237915039062,
"logps/rejected": -216.1865997314453,
"loss": 0.6895,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.037272509187459946,
"rewards/margins": 0.004425130784511566,
"rewards/rejected": 0.03284738212823868,
"step": 6830
},
{
"epoch": 1.2,
"learning_rate": 6.629722921914357e-08,
"logits/chosen": -2.8168251514434814,
"logits/rejected": -2.748887062072754,
"logps/chosen": -261.4979248046875,
"logps/rejected": -232.7153778076172,
"loss": 0.6889,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.041307780891656876,
"rewards/margins": 0.01554332859814167,
"rewards/rejected": 0.025764450430870056,
"step": 6840
},
{
"epoch": 1.2,
"learning_rate": 6.624685138539042e-08,
"logits/chosen": -2.751751661300659,
"logits/rejected": -2.7708382606506348,
"logps/chosen": -273.7115783691406,
"logps/rejected": -220.8414306640625,
"loss": 0.6894,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.037936046719551086,
"rewards/margins": 0.006723390426486731,
"rewards/rejected": 0.03121265396475792,
"step": 6850
},
{
"epoch": 1.2,
"learning_rate": 6.619647355163728e-08,
"logits/chosen": -2.800870180130005,
"logits/rejected": -2.7695047855377197,
"logps/chosen": -238.0107421875,
"logps/rejected": -195.6055450439453,
"loss": 0.6899,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03982401639223099,
"rewards/margins": 0.009933261200785637,
"rewards/rejected": 0.0298907570540905,
"step": 6860
},
{
"epoch": 1.2,
"learning_rate": 6.614609571788413e-08,
"logits/chosen": -2.7755208015441895,
"logits/rejected": -2.731126070022583,
"logps/chosen": -205.5043487548828,
"logps/rejected": -194.66209411621094,
"loss": 0.6888,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.03579959273338318,
"rewards/margins": 0.009841179475188255,
"rewards/rejected": 0.025958415120840073,
"step": 6870
},
{
"epoch": 1.21,
"learning_rate": 6.609571788413097e-08,
"logits/chosen": -2.7811360359191895,
"logits/rejected": -2.747478485107422,
"logps/chosen": -218.49624633789062,
"logps/rejected": -224.67333984375,
"loss": 0.6916,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.03223881870508194,
"rewards/margins": -0.00041040778160095215,
"rewards/rejected": 0.03264923021197319,
"step": 6880
},
{
"epoch": 1.21,
"learning_rate": 6.604534005037782e-08,
"logits/chosen": -2.829068660736084,
"logits/rejected": -2.851719617843628,
"logps/chosen": -255.1793670654297,
"logps/rejected": -238.48300170898438,
"loss": 0.6894,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.031496562063694,
"rewards/margins": 0.0001958387001650408,
"rewards/rejected": 0.03130072355270386,
"step": 6890
},
{
"epoch": 1.21,
"learning_rate": 6.599496221662468e-08,
"logits/chosen": -2.751180410385132,
"logits/rejected": -2.813422679901123,
"logps/chosen": -252.8855438232422,
"logps/rejected": -217.68637084960938,
"loss": 0.6894,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.03818538039922714,
"rewards/margins": 0.0018034654203802347,
"rewards/rejected": 0.03638191893696785,
"step": 6900
},
{
"epoch": 1.21,
"learning_rate": 6.594458438287154e-08,
"logits/chosen": -2.712439775466919,
"logits/rejected": -2.7637240886688232,
"logps/chosen": -294.4551086425781,
"logps/rejected": -206.96664428710938,
"loss": 0.69,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.03531162813305855,
"rewards/margins": 0.006781014613807201,
"rewards/rejected": 0.028530608862638474,
"step": 6910
},
{
"epoch": 1.21,
"learning_rate": 6.589420654911838e-08,
"logits/chosen": -2.796703577041626,
"logits/rejected": -2.817638635635376,
"logps/chosen": -186.1031951904297,
"logps/rejected": -150.4288787841797,
"loss": 0.688,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.027689915150403976,
"rewards/margins": 0.010430497117340565,
"rewards/rejected": 0.017259418964385986,
"step": 6920
},
{
"epoch": 1.21,
"learning_rate": 6.584382871536524e-08,
"logits/chosen": -2.7453088760375977,
"logits/rejected": -2.776571750640869,
"logps/chosen": -225.50698852539062,
"logps/rejected": -196.79696655273438,
"loss": 0.6888,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03130626305937767,
"rewards/margins": 0.006553110666573048,
"rewards/rejected": 0.0247531495988369,
"step": 6930
},
{
"epoch": 1.22,
"learning_rate": 6.579345088161209e-08,
"logits/chosen": -2.7517857551574707,
"logits/rejected": -2.759016513824463,
"logps/chosen": -189.88516235351562,
"logps/rejected": -184.5245819091797,
"loss": 0.6896,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.02992168627679348,
"rewards/margins": 0.001992257311940193,
"rewards/rejected": 0.027929430827498436,
"step": 6940
},
{
"epoch": 1.22,
"learning_rate": 6.574307304785894e-08,
"logits/chosen": -2.815490245819092,
"logits/rejected": -2.803900718688965,
"logps/chosen": -210.9685821533203,
"logps/rejected": -191.39927673339844,
"loss": 0.6907,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.034951768815517426,
"rewards/margins": 0.0016877256566658616,
"rewards/rejected": 0.03326404467225075,
"step": 6950
},
{
"epoch": 1.22,
"learning_rate": 6.569269521410579e-08,
"logits/chosen": -2.803596019744873,
"logits/rejected": -2.786287546157837,
"logps/chosen": -248.3104248046875,
"logps/rejected": -213.3457489013672,
"loss": 0.689,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04742354154586792,
"rewards/margins": 0.01468456070870161,
"rewards/rejected": 0.032738976180553436,
"step": 6960
},
{
"epoch": 1.22,
"learning_rate": 6.564231738035264e-08,
"logits/chosen": -2.7051408290863037,
"logits/rejected": -2.6857523918151855,
"logps/chosen": -226.7938232421875,
"logps/rejected": -225.24612426757812,
"loss": 0.6894,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.03250659257173538,
"rewards/margins": -0.001109436503611505,
"rewards/rejected": 0.03361602872610092,
"step": 6970
},
{
"epoch": 1.22,
"learning_rate": 6.559193954659949e-08,
"logits/chosen": -2.7691562175750732,
"logits/rejected": -2.7059037685394287,
"logps/chosen": -235.966552734375,
"logps/rejected": -244.332275390625,
"loss": 0.691,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.03826393932104111,
"rewards/margins": 0.002380301710218191,
"rewards/rejected": 0.03588363528251648,
"step": 6980
},
{
"epoch": 1.22,
"learning_rate": 6.554156171284635e-08,
"logits/chosen": -2.773897647857666,
"logits/rejected": -2.8118696212768555,
"logps/chosen": -279.00213623046875,
"logps/rejected": -199.22181701660156,
"loss": 0.6897,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.03939899057149887,
"rewards/margins": 0.010439836420118809,
"rewards/rejected": 0.028959155082702637,
"step": 6990
},
{
"epoch": 1.23,
"learning_rate": 6.549118387909319e-08,
"logits/chosen": -2.78377366065979,
"logits/rejected": -2.8232734203338623,
"logps/chosen": -222.0625,
"logps/rejected": -167.61061096191406,
"loss": 0.6889,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03677304834127426,
"rewards/margins": 0.011829810217022896,
"rewards/rejected": 0.024943236261606216,
"step": 7000
},
{
"epoch": 1.23,
"learning_rate": 6.544080604534004e-08,
"logits/chosen": -2.801302671432495,
"logits/rejected": -2.7772815227508545,
"logps/chosen": -223.4099884033203,
"logps/rejected": -201.2372283935547,
"loss": 0.6891,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.034436147660017014,
"rewards/margins": 0.012764090672135353,
"rewards/rejected": 0.02167206071317196,
"step": 7010
},
{
"epoch": 1.23,
"learning_rate": 6.539042821158691e-08,
"logits/chosen": -2.726637601852417,
"logits/rejected": -2.7596089839935303,
"logps/chosen": -244.93588256835938,
"logps/rejected": -204.8834991455078,
"loss": 0.6892,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03578575700521469,
"rewards/margins": 0.005086420103907585,
"rewards/rejected": 0.030699338763952255,
"step": 7020
},
{
"epoch": 1.23,
"learning_rate": 6.534005037783376e-08,
"logits/chosen": -2.778423547744751,
"logits/rejected": -2.8102736473083496,
"logps/chosen": -235.8497772216797,
"logps/rejected": -181.15029907226562,
"loss": 0.6885,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.0325014665722847,
"rewards/margins": 0.010433828458189964,
"rewards/rejected": 0.022067639976739883,
"step": 7030
},
{
"epoch": 1.23,
"learning_rate": 6.52896725440806e-08,
"logits/chosen": -2.790149211883545,
"logits/rejected": -2.782501459121704,
"logps/chosen": -244.16952514648438,
"logps/rejected": -217.7505340576172,
"loss": 0.6898,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.032779667526483536,
"rewards/margins": 0.004313626326620579,
"rewards/rejected": 0.028466040268540382,
"step": 7040
},
{
"epoch": 1.23,
"learning_rate": 6.523929471032745e-08,
"logits/chosen": -2.685401201248169,
"logits/rejected": -2.7205746173858643,
"logps/chosen": -246.46542358398438,
"logps/rejected": -218.16384887695312,
"loss": 0.6883,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03928607702255249,
"rewards/margins": 0.012703100219368935,
"rewards/rejected": 0.026582980528473854,
"step": 7050
},
{
"epoch": 1.24,
"learning_rate": 6.518891687657431e-08,
"logits/chosen": -2.763960599899292,
"logits/rejected": -2.6985137462615967,
"logps/chosen": -219.4324188232422,
"logps/rejected": -199.53598022460938,
"loss": 0.6894,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03679573908448219,
"rewards/margins": 0.003578348783776164,
"rewards/rejected": 0.03321739658713341,
"step": 7060
},
{
"epoch": 1.24,
"learning_rate": 6.513853904282116e-08,
"logits/chosen": -2.739204168319702,
"logits/rejected": -2.721792221069336,
"logps/chosen": -221.15011596679688,
"logps/rejected": -224.3832550048828,
"loss": 0.6879,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.03717418760061264,
"rewards/margins": 0.006488792598247528,
"rewards/rejected": 0.030685395002365112,
"step": 7070
},
{
"epoch": 1.24,
"learning_rate": 6.5088161209068e-08,
"logits/chosen": -2.763201951980591,
"logits/rejected": -2.816208839416504,
"logps/chosen": -219.6378631591797,
"logps/rejected": -171.7489471435547,
"loss": 0.6893,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.03814969211816788,
"rewards/margins": 0.015910113230347633,
"rewards/rejected": 0.02223958447575569,
"step": 7080
},
{
"epoch": 1.24,
"learning_rate": 6.503778337531486e-08,
"logits/chosen": -2.749999523162842,
"logits/rejected": -2.7644400596618652,
"logps/chosen": -256.59527587890625,
"logps/rejected": -254.48568725585938,
"loss": 0.6909,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": 0.029433051124215126,
"rewards/margins": -0.0038326564244925976,
"rewards/rejected": 0.03326570615172386,
"step": 7090
},
{
"epoch": 1.24,
"learning_rate": 6.498740554156171e-08,
"logits/chosen": -2.7424628734588623,
"logits/rejected": -2.669203281402588,
"logps/chosen": -217.8045654296875,
"logps/rejected": -284.6188049316406,
"loss": 0.6892,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.03091282583773136,
"rewards/margins": -0.0043990714475512505,
"rewards/rejected": 0.03531189635396004,
"step": 7100
},
{
"epoch": 1.25,
"learning_rate": 6.493702770780855e-08,
"logits/chosen": -2.7484242916107178,
"logits/rejected": -2.7699131965637207,
"logps/chosen": -222.022705078125,
"logps/rejected": -180.71083068847656,
"loss": 0.6901,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03578049689531326,
"rewards/margins": 0.007164050824940205,
"rewards/rejected": 0.028616448864340782,
"step": 7110
},
{
"epoch": 1.25,
"learning_rate": 6.48866498740554e-08,
"logits/chosen": -2.7241392135620117,
"logits/rejected": -2.7856979370117188,
"logps/chosen": -220.6631317138672,
"logps/rejected": -172.29763793945312,
"loss": 0.6881,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.03620423376560211,
"rewards/margins": 0.01442769169807434,
"rewards/rejected": 0.02177654579281807,
"step": 7120
},
{
"epoch": 1.25,
"learning_rate": 6.483627204030227e-08,
"logits/chosen": -2.6797337532043457,
"logits/rejected": -2.677027702331543,
"logps/chosen": -216.7772979736328,
"logps/rejected": -199.2020721435547,
"loss": 0.6881,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03498489409685135,
"rewards/margins": 0.0047217002138495445,
"rewards/rejected": 0.03026319481432438,
"step": 7130
},
{
"epoch": 1.25,
"learning_rate": 6.478589420654912e-08,
"logits/chosen": -2.7731869220733643,
"logits/rejected": -2.758033275604248,
"logps/chosen": -210.3363037109375,
"logps/rejected": -220.9199676513672,
"loss": 0.688,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.03830721229314804,
"rewards/margins": 0.009248893707990646,
"rewards/rejected": 0.029058322310447693,
"step": 7140
},
{
"epoch": 1.25,
"learning_rate": 6.473551637279596e-08,
"logits/chosen": -2.840115547180176,
"logits/rejected": -2.8175790309906006,
"logps/chosen": -228.0071258544922,
"logps/rejected": -200.12808227539062,
"loss": 0.6891,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03204935044050217,
"rewards/margins": 0.0035434868186712265,
"rewards/rejected": 0.02850586175918579,
"step": 7150
},
{
"epoch": 1.25,
"learning_rate": 6.468513853904282e-08,
"logits/chosen": -2.7763142585754395,
"logits/rejected": -2.729067802429199,
"logps/chosen": -198.84445190429688,
"logps/rejected": -188.24356079101562,
"loss": 0.6889,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.02600068226456642,
"rewards/margins": 0.002334971446543932,
"rewards/rejected": 0.023665711283683777,
"step": 7160
},
{
"epoch": 1.26,
"learning_rate": 6.463476070528967e-08,
"logits/chosen": -2.790109395980835,
"logits/rejected": -2.776125431060791,
"logps/chosen": -250.983642578125,
"logps/rejected": -225.20327758789062,
"loss": 0.6897,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.05125053972005844,
"rewards/margins": 0.00900472141802311,
"rewards/rejected": 0.042245812714099884,
"step": 7170
},
{
"epoch": 1.26,
"learning_rate": 6.458438287153653e-08,
"logits/chosen": -2.85467529296875,
"logits/rejected": -2.8630192279815674,
"logps/chosen": -248.15420532226562,
"logps/rejected": -203.410400390625,
"loss": 0.6895,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.0435900017619133,
"rewards/margins": 0.013718393631279469,
"rewards/rejected": 0.02987160161137581,
"step": 7180
},
{
"epoch": 1.26,
"learning_rate": 6.453400503778337e-08,
"logits/chosen": -2.787590503692627,
"logits/rejected": -2.786054849624634,
"logps/chosen": -215.96484375,
"logps/rejected": -205.36135864257812,
"loss": 0.6911,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.030155668035149574,
"rewards/margins": 0.001419505337253213,
"rewards/rejected": 0.028736162930727005,
"step": 7190
},
{
"epoch": 1.26,
"learning_rate": 6.448362720403022e-08,
"logits/chosen": -2.7419791221618652,
"logits/rejected": -2.7809367179870605,
"logps/chosen": -231.2300262451172,
"logps/rejected": -209.7133026123047,
"loss": 0.689,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.043003469705581665,
"rewards/margins": 0.012471351772546768,
"rewards/rejected": 0.030532116070389748,
"step": 7200
},
{
"epoch": 1.26,
"learning_rate": 6.443324937027707e-08,
"logits/chosen": -2.771419048309326,
"logits/rejected": -2.7687599658966064,
"logps/chosen": -266.37310791015625,
"logps/rejected": -210.47946166992188,
"loss": 0.6914,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.035980530083179474,
"rewards/margins": 0.006279982626438141,
"rewards/rejected": 0.02970055118203163,
"step": 7210
},
{
"epoch": 1.26,
"learning_rate": 6.438287153652393e-08,
"logits/chosen": -2.7209925651550293,
"logits/rejected": -2.753868579864502,
"logps/chosen": -244.1683349609375,
"logps/rejected": -209.34567260742188,
"loss": 0.6902,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04534623771905899,
"rewards/margins": 0.00936298631131649,
"rewards/rejected": 0.03598325327038765,
"step": 7220
},
{
"epoch": 1.27,
"learning_rate": 6.433249370277077e-08,
"logits/chosen": -2.7852845191955566,
"logits/rejected": -2.7609314918518066,
"logps/chosen": -219.0021209716797,
"logps/rejected": -212.36203002929688,
"loss": 0.6908,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.034276049584150314,
"rewards/margins": 0.008765382692217827,
"rewards/rejected": 0.025510672479867935,
"step": 7230
},
{
"epoch": 1.27,
"learning_rate": 6.428211586901763e-08,
"logits/chosen": -2.7715468406677246,
"logits/rejected": -2.7390708923339844,
"logps/chosen": -244.0713348388672,
"logps/rejected": -203.73193359375,
"loss": 0.6893,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.04323107749223709,
"rewards/margins": 0.014766479842364788,
"rewards/rejected": 0.02846459485590458,
"step": 7240
},
{
"epoch": 1.27,
"learning_rate": 6.423173803526449e-08,
"logits/chosen": -2.7359414100646973,
"logits/rejected": -2.7200896739959717,
"logps/chosen": -236.83010864257812,
"logps/rejected": -222.8236083984375,
"loss": 0.6886,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03487788513302803,
"rewards/margins": 0.003767541376873851,
"rewards/rejected": 0.03111034631729126,
"step": 7250
},
{
"epoch": 1.27,
"learning_rate": 6.418136020151134e-08,
"logits/chosen": -2.7496371269226074,
"logits/rejected": -2.7715988159179688,
"logps/chosen": -237.1099395751953,
"logps/rejected": -190.89756774902344,
"loss": 0.6883,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.04079810902476311,
"rewards/margins": 0.012925440445542336,
"rewards/rejected": 0.027872666716575623,
"step": 7260
},
{
"epoch": 1.27,
"learning_rate": 6.413098236775818e-08,
"logits/chosen": -2.79183292388916,
"logits/rejected": -2.8067638874053955,
"logps/chosen": -239.8271484375,
"logps/rejected": -196.8553924560547,
"loss": 0.6886,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.04036902263760567,
"rewards/margins": 0.008599973283708096,
"rewards/rejected": 0.031769048422575,
"step": 7270
},
{
"epoch": 1.28,
"learning_rate": 6.408060453400504e-08,
"logits/chosen": -2.7779862880706787,
"logits/rejected": -2.7364373207092285,
"logps/chosen": -215.1895294189453,
"logps/rejected": -221.6739501953125,
"loss": 0.6881,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03108001872897148,
"rewards/margins": 0.007479669060558081,
"rewards/rejected": 0.023600349202752113,
"step": 7280
},
{
"epoch": 1.28,
"learning_rate": 6.403022670025189e-08,
"logits/chosen": -2.7336158752441406,
"logits/rejected": -2.7742183208465576,
"logps/chosen": -224.93276977539062,
"logps/rejected": -220.05130004882812,
"loss": 0.6887,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.032671328634023666,
"rewards/margins": 0.004601246677339077,
"rewards/rejected": 0.028070081025362015,
"step": 7290
},
{
"epoch": 1.28,
"learning_rate": 6.397984886649874e-08,
"logits/chosen": -2.704530715942383,
"logits/rejected": -2.6919538974761963,
"logps/chosen": -196.310546875,
"logps/rejected": -192.64761352539062,
"loss": 0.6893,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.034642450511455536,
"rewards/margins": 0.008061992935836315,
"rewards/rejected": 0.026580458506941795,
"step": 7300
},
{
"epoch": 1.28,
"learning_rate": 6.392947103274558e-08,
"logits/chosen": -2.7123913764953613,
"logits/rejected": -2.692824602127075,
"logps/chosen": -200.9581756591797,
"logps/rejected": -160.29251098632812,
"loss": 0.6897,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.030062520876526833,
"rewards/margins": 0.012599813751876354,
"rewards/rejected": 0.017462706193327904,
"step": 7310
},
{
"epoch": 1.28,
"learning_rate": 6.387909319899244e-08,
"logits/chosen": -2.7910399436950684,
"logits/rejected": -2.8223717212677,
"logps/chosen": -243.82861328125,
"logps/rejected": -190.62478637695312,
"loss": 0.6883,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": 0.05294889211654663,
"rewards/margins": 0.02855229750275612,
"rewards/rejected": 0.024396590888500214,
"step": 7320
},
{
"epoch": 1.28,
"learning_rate": 6.382871536523929e-08,
"logits/chosen": -2.7878623008728027,
"logits/rejected": -2.789745330810547,
"logps/chosen": -279.63775634765625,
"logps/rejected": -233.55050659179688,
"loss": 0.6891,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.04993782192468643,
"rewards/margins": 0.010094448924064636,
"rewards/rejected": 0.039843373000621796,
"step": 7330
},
{
"epoch": 1.29,
"learning_rate": 6.377833753148614e-08,
"logits/chosen": -2.8130502700805664,
"logits/rejected": -2.828782796859741,
"logps/chosen": -216.92153930664062,
"logps/rejected": -179.07345581054688,
"loss": 0.6902,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.037634026259183884,
"rewards/margins": 0.011927349492907524,
"rewards/rejected": 0.02570667862892151,
"step": 7340
},
{
"epoch": 1.29,
"learning_rate": 6.3727959697733e-08,
"logits/chosen": -2.717914342880249,
"logits/rejected": -2.771929979324341,
"logps/chosen": -272.27349853515625,
"logps/rejected": -217.73965454101562,
"loss": 0.6891,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.04304666072130203,
"rewards/margins": 0.01667637750506401,
"rewards/rejected": 0.026370281353592873,
"step": 7350
},
{
"epoch": 1.29,
"learning_rate": 6.367758186397985e-08,
"logits/chosen": -2.7765262126922607,
"logits/rejected": -2.756239175796509,
"logps/chosen": -245.5876922607422,
"logps/rejected": -211.84426879882812,
"loss": 0.6886,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.04092712327837944,
"rewards/margins": 0.010894590988755226,
"rewards/rejected": 0.030032526701688766,
"step": 7360
},
{
"epoch": 1.29,
"learning_rate": 6.36272040302267e-08,
"logits/chosen": -2.7805514335632324,
"logits/rejected": -2.779824733734131,
"logps/chosen": -232.1643829345703,
"logps/rejected": -227.3907470703125,
"loss": 0.6903,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.04033838212490082,
"rewards/margins": -0.0015016479883342981,
"rewards/rejected": 0.041840024292469025,
"step": 7370
},
{
"epoch": 1.29,
"learning_rate": 6.357682619647356e-08,
"logits/chosen": -2.715909004211426,
"logits/rejected": -2.6816649436950684,
"logps/chosen": -183.8916473388672,
"logps/rejected": -177.9539794921875,
"loss": 0.69,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.02817304991185665,
"rewards/margins": 0.002602068241685629,
"rewards/rejected": 0.025570983067154884,
"step": 7380
},
{
"epoch": 1.29,
"learning_rate": 6.35264483627204e-08,
"logits/chosen": -2.764040470123291,
"logits/rejected": -2.7185869216918945,
"logps/chosen": -279.495361328125,
"logps/rejected": -254.57553100585938,
"loss": 0.688,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.04607158154249191,
"rewards/margins": 0.00835057720541954,
"rewards/rejected": 0.037721000611782074,
"step": 7390
},
{
"epoch": 1.3,
"learning_rate": 6.347607052896725e-08,
"logits/chosen": -2.691213607788086,
"logits/rejected": -2.580820083618164,
"logps/chosen": -216.9579620361328,
"logps/rejected": -203.49806213378906,
"loss": 0.6893,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.03406810015439987,
"rewards/margins": 0.004827213007956743,
"rewards/rejected": 0.029240887612104416,
"step": 7400
},
{
"epoch": 1.3,
"learning_rate": 6.34256926952141e-08,
"logits/chosen": -2.789217710494995,
"logits/rejected": -2.7983765602111816,
"logps/chosen": -259.81915283203125,
"logps/rejected": -181.50772094726562,
"loss": 0.6889,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": 0.038249146193265915,
"rewards/margins": 0.019794996827840805,
"rewards/rejected": 0.01845415122807026,
"step": 7410
},
{
"epoch": 1.3,
"learning_rate": 6.337531486146095e-08,
"logits/chosen": -2.7692363262176514,
"logits/rejected": -2.7888898849487305,
"logps/chosen": -251.02481079101562,
"logps/rejected": -207.87417602539062,
"loss": 0.689,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0431194081902504,
"rewards/margins": 0.009726546704769135,
"rewards/rejected": 0.03339286148548126,
"step": 7420
},
{
"epoch": 1.3,
"learning_rate": 6.33249370277078e-08,
"logits/chosen": -2.8098390102386475,
"logits/rejected": -2.824765682220459,
"logps/chosen": -288.68280029296875,
"logps/rejected": -209.61767578125,
"loss": 0.6864,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.048886384814977646,
"rewards/margins": 0.018948834389448166,
"rewards/rejected": 0.02993755042552948,
"step": 7430
},
{
"epoch": 1.3,
"learning_rate": 6.327455919395465e-08,
"logits/chosen": -2.7200918197631836,
"logits/rejected": -2.791701316833496,
"logps/chosen": -197.84213256835938,
"logps/rejected": -163.2316436767578,
"loss": 0.69,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03175193443894386,
"rewards/margins": 0.009572578594088554,
"rewards/rejected": 0.022179359570145607,
"step": 7440
},
{
"epoch": 1.3,
"learning_rate": 6.322418136020151e-08,
"logits/chosen": -2.7373557090759277,
"logits/rejected": -2.7854480743408203,
"logps/chosen": -183.2852325439453,
"logps/rejected": -177.6833038330078,
"loss": 0.6893,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03157498314976692,
"rewards/margins": 0.005984650459140539,
"rewards/rejected": 0.025590334087610245,
"step": 7450
},
{
"epoch": 1.31,
"learning_rate": 6.317380352644836e-08,
"logits/chosen": -2.798292875289917,
"logits/rejected": -2.690913677215576,
"logps/chosen": -223.384033203125,
"logps/rejected": -191.24310302734375,
"loss": 0.6894,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03310397267341614,
"rewards/margins": 0.01318474393337965,
"rewards/rejected": 0.019919229671359062,
"step": 7460
},
{
"epoch": 1.31,
"learning_rate": 6.312342569269521e-08,
"logits/chosen": -2.8380043506622314,
"logits/rejected": -2.7938342094421387,
"logps/chosen": -252.09130859375,
"logps/rejected": -234.51791381835938,
"loss": 0.6881,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04607817903161049,
"rewards/margins": 0.009110006503760815,
"rewards/rejected": 0.0369681641459465,
"step": 7470
},
{
"epoch": 1.31,
"learning_rate": 6.307304785894207e-08,
"logits/chosen": -2.7199976444244385,
"logits/rejected": -2.7746763229370117,
"logps/chosen": -224.08078002929688,
"logps/rejected": -199.91787719726562,
"loss": 0.6891,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03400200232863426,
"rewards/margins": 0.0022418289445340633,
"rewards/rejected": 0.03176017105579376,
"step": 7480
},
{
"epoch": 1.31,
"learning_rate": 6.302267002518892e-08,
"logits/chosen": -2.731687068939209,
"logits/rejected": -2.7257843017578125,
"logps/chosen": -239.6183624267578,
"logps/rejected": -202.96115112304688,
"loss": 0.6883,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03186950460076332,
"rewards/margins": 0.008324464783072472,
"rewards/rejected": 0.023545041680336,
"step": 7490
},
{
"epoch": 1.31,
"learning_rate": 6.297229219143576e-08,
"logits/chosen": -2.738438129425049,
"logits/rejected": -2.806363821029663,
"logps/chosen": -176.00735473632812,
"logps/rejected": -169.10317993164062,
"loss": 0.6886,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.033585112541913986,
"rewards/margins": 0.007096168585121632,
"rewards/rejected": 0.02648894488811493,
"step": 7500
},
{
"epoch": 1.32,
"learning_rate": 6.292191435768262e-08,
"logits/chosen": -2.7676918506622314,
"logits/rejected": -2.723275899887085,
"logps/chosen": -244.68380737304688,
"logps/rejected": -214.3140869140625,
"loss": 0.6881,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.049413811415433884,
"rewards/margins": 0.013775454834103584,
"rewards/rejected": 0.03563835844397545,
"step": 7510
},
{
"epoch": 1.32,
"learning_rate": 6.287153652392947e-08,
"logits/chosen": -2.7488560676574707,
"logits/rejected": -2.771021842956543,
"logps/chosen": -209.1370849609375,
"logps/rejected": -213.5133056640625,
"loss": 0.6881,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.033164605498313904,
"rewards/margins": 0.0037708343006670475,
"rewards/rejected": 0.029393767938017845,
"step": 7520
},
{
"epoch": 1.32,
"learning_rate": 6.282115869017632e-08,
"logits/chosen": -2.7546322345733643,
"logits/rejected": -2.8115854263305664,
"logps/chosen": -228.2063751220703,
"logps/rejected": -213.37265014648438,
"loss": 0.6904,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.042360819876194,
"rewards/margins": 0.0021514396648854017,
"rewards/rejected": 0.04020937532186508,
"step": 7530
},
{
"epoch": 1.32,
"learning_rate": 6.277078085642316e-08,
"logits/chosen": -2.8055498600006104,
"logits/rejected": -2.8536624908447266,
"logps/chosen": -249.27444458007812,
"logps/rejected": -214.2854766845703,
"loss": 0.6912,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03579330071806908,
"rewards/margins": 0.0017019972437992692,
"rewards/rejected": 0.03409130498766899,
"step": 7540
},
{
"epoch": 1.32,
"learning_rate": 6.272040302267002e-08,
"logits/chosen": -2.7170093059539795,
"logits/rejected": -2.7954814434051514,
"logps/chosen": -202.75704956054688,
"logps/rejected": -189.86465454101562,
"loss": 0.6892,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03642931208014488,
"rewards/margins": 0.004201197065412998,
"rewards/rejected": 0.03222811967134476,
"step": 7550
},
{
"epoch": 1.32,
"learning_rate": 6.267002518891687e-08,
"logits/chosen": -2.6571552753448486,
"logits/rejected": -2.666952133178711,
"logps/chosen": -255.24887084960938,
"logps/rejected": -238.71731567382812,
"loss": 0.6889,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03816863149404526,
"rewards/margins": 0.0025174126494675875,
"rewards/rejected": 0.03565122187137604,
"step": 7560
},
{
"epoch": 1.33,
"learning_rate": 6.261964735516372e-08,
"logits/chosen": -2.7783854007720947,
"logits/rejected": -2.782365322113037,
"logps/chosen": -278.375732421875,
"logps/rejected": -238.59201049804688,
"loss": 0.6902,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.05053055286407471,
"rewards/margins": 0.008491361513733864,
"rewards/rejected": 0.042039185762405396,
"step": 7570
},
{
"epoch": 1.33,
"learning_rate": 6.256926952141058e-08,
"logits/chosen": -2.7886173725128174,
"logits/rejected": -2.8333420753479004,
"logps/chosen": -265.0281677246094,
"logps/rejected": -229.58602905273438,
"loss": 0.6894,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03801819309592247,
"rewards/margins": 0.005499082151800394,
"rewards/rejected": 0.032519109547138214,
"step": 7580
},
{
"epoch": 1.33,
"learning_rate": 6.251889168765743e-08,
"logits/chosen": -2.7609009742736816,
"logits/rejected": -2.722909450531006,
"logps/chosen": -224.86181640625,
"logps/rejected": -174.26095581054688,
"loss": 0.6867,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.04278299957513809,
"rewards/margins": 0.019222671166062355,
"rewards/rejected": 0.023560328409075737,
"step": 7590
},
{
"epoch": 1.33,
"learning_rate": 6.246851385390429e-08,
"logits/chosen": -2.7045106887817383,
"logits/rejected": -2.762742519378662,
"logps/chosen": -226.1327362060547,
"logps/rejected": -192.94805908203125,
"loss": 0.6891,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03624294325709343,
"rewards/margins": 0.008845340460538864,
"rewards/rejected": 0.027397602796554565,
"step": 7600
},
{
"epoch": 1.33,
"learning_rate": 6.241813602015114e-08,
"logits/chosen": -2.7494304180145264,
"logits/rejected": -2.7993853092193604,
"logps/chosen": -240.58883666992188,
"logps/rejected": -228.0128631591797,
"loss": 0.6872,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.051678262650966644,
"rewards/margins": 0.012700071558356285,
"rewards/rejected": 0.038978200405836105,
"step": 7610
},
{
"epoch": 1.33,
"learning_rate": 6.236775818639798e-08,
"logits/chosen": -2.705895185470581,
"logits/rejected": -2.704624891281128,
"logps/chosen": -237.9052734375,
"logps/rejected": -214.38229370117188,
"loss": 0.6887,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0426960252225399,
"rewards/margins": 0.01083569135516882,
"rewards/rejected": 0.03186033293604851,
"step": 7620
},
{
"epoch": 1.34,
"learning_rate": 6.231738035264483e-08,
"logits/chosen": -2.694300889968872,
"logits/rejected": -2.7320556640625,
"logps/chosen": -244.7444305419922,
"logps/rejected": -211.509521484375,
"loss": 0.6882,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.04373529553413391,
"rewards/margins": 0.009587273001670837,
"rewards/rejected": 0.034148018807172775,
"step": 7630
},
{
"epoch": 1.34,
"learning_rate": 6.226700251889169e-08,
"logits/chosen": -2.657388687133789,
"logits/rejected": -2.7366836071014404,
"logps/chosen": -284.2294921875,
"logps/rejected": -204.66275024414062,
"loss": 0.6884,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.047968313097953796,
"rewards/margins": 0.021980399265885353,
"rewards/rejected": 0.025987911969423294,
"step": 7640
},
{
"epoch": 1.34,
"learning_rate": 6.221662468513854e-08,
"logits/chosen": -2.7871079444885254,
"logits/rejected": -2.742713451385498,
"logps/chosen": -217.3256072998047,
"logps/rejected": -193.50462341308594,
"loss": 0.6891,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04595683142542839,
"rewards/margins": 0.014400948770344257,
"rewards/rejected": 0.03155588358640671,
"step": 7650
},
{
"epoch": 1.34,
"learning_rate": 6.216624685138538e-08,
"logits/chosen": -2.7406857013702393,
"logits/rejected": -2.7888526916503906,
"logps/chosen": -274.1748962402344,
"logps/rejected": -234.21694946289062,
"loss": 0.6902,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.04528680071234703,
"rewards/margins": 0.00935632549226284,
"rewards/rejected": 0.03593047335743904,
"step": 7660
},
{
"epoch": 1.34,
"learning_rate": 6.211586901763223e-08,
"logits/chosen": -2.7559306621551514,
"logits/rejected": -2.737565755844116,
"logps/chosen": -202.5470428466797,
"logps/rejected": -195.29730224609375,
"loss": 0.6876,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.04031279683113098,
"rewards/margins": 0.015136400237679482,
"rewards/rejected": 0.02517639473080635,
"step": 7670
},
{
"epoch": 1.35,
"learning_rate": 6.206549118387909e-08,
"logits/chosen": -2.7704107761383057,
"logits/rejected": -2.7382752895355225,
"logps/chosen": -218.0789031982422,
"logps/rejected": -188.13656616210938,
"loss": 0.6889,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03927340358495712,
"rewards/margins": 0.005905534606426954,
"rewards/rejected": 0.03336786851286888,
"step": 7680
},
{
"epoch": 1.35,
"learning_rate": 6.201511335012594e-08,
"logits/chosen": -2.860550880432129,
"logits/rejected": -2.737292528152466,
"logps/chosen": -204.9586181640625,
"logps/rejected": -200.66024780273438,
"loss": 0.6898,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.03624052554368973,
"rewards/margins": 0.00042196764843538404,
"rewards/rejected": 0.03581856191158295,
"step": 7690
},
{
"epoch": 1.35,
"learning_rate": 6.19647355163728e-08,
"logits/chosen": -2.827122211456299,
"logits/rejected": -2.780107021331787,
"logps/chosen": -205.1537628173828,
"logps/rejected": -179.7675018310547,
"loss": 0.6877,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03878549858927727,
"rewards/margins": 0.011726005002856255,
"rewards/rejected": 0.027059491723775864,
"step": 7700
},
{
"epoch": 1.35,
"learning_rate": 6.191435768261965e-08,
"logits/chosen": -2.7009811401367188,
"logits/rejected": -2.671569347381592,
"logps/chosen": -197.73291015625,
"logps/rejected": -186.85595703125,
"loss": 0.6911,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.025883939117193222,
"rewards/margins": 0.004282969981431961,
"rewards/rejected": 0.02160097099840641,
"step": 7710
},
{
"epoch": 1.35,
"learning_rate": 6.18639798488665e-08,
"logits/chosen": -2.832324266433716,
"logits/rejected": -2.758772850036621,
"logps/chosen": -247.593017578125,
"logps/rejected": -217.5821533203125,
"loss": 0.6867,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.05130542069673538,
"rewards/margins": 0.017530951648950577,
"rewards/rejected": 0.033774472773075104,
"step": 7720
},
{
"epoch": 1.35,
"learning_rate": 6.181360201511334e-08,
"logits/chosen": -2.813231945037842,
"logits/rejected": -2.801682949066162,
"logps/chosen": -224.65103149414062,
"logps/rejected": -162.23861694335938,
"loss": 0.6883,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.04042666405439377,
"rewards/margins": 0.014801084995269775,
"rewards/rejected": 0.02562558650970459,
"step": 7730
},
{
"epoch": 1.36,
"learning_rate": 6.17632241813602e-08,
"logits/chosen": -2.7659387588500977,
"logits/rejected": -2.734480619430542,
"logps/chosen": -200.85885620117188,
"logps/rejected": -178.37416076660156,
"loss": 0.6863,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.04493881016969681,
"rewards/margins": 0.014324108138680458,
"rewards/rejected": 0.030614707618951797,
"step": 7740
},
{
"epoch": 1.36,
"learning_rate": 6.171284634760705e-08,
"logits/chosen": -2.7255687713623047,
"logits/rejected": -2.718503713607788,
"logps/chosen": -214.28494262695312,
"logps/rejected": -213.13113403320312,
"loss": 0.6882,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.04565887898206711,
"rewards/margins": 0.004408498294651508,
"rewards/rejected": 0.041250377893447876,
"step": 7750
},
{
"epoch": 1.36,
"learning_rate": 6.16624685138539e-08,
"logits/chosen": -2.802783489227295,
"logits/rejected": -2.802086591720581,
"logps/chosen": -226.2981414794922,
"logps/rejected": -178.6344757080078,
"loss": 0.6887,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03931064531207085,
"rewards/margins": 0.010295582935214043,
"rewards/rejected": 0.029015064239501953,
"step": 7760
},
{
"epoch": 1.36,
"learning_rate": 6.161209068010074e-08,
"logits/chosen": -2.771225690841675,
"logits/rejected": -2.7833735942840576,
"logps/chosen": -181.8852081298828,
"logps/rejected": -168.8794708251953,
"loss": 0.6892,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.02663729153573513,
"rewards/margins": 0.00531434640288353,
"rewards/rejected": 0.0213229488581419,
"step": 7770
},
{
"epoch": 1.36,
"learning_rate": 6.15617128463476e-08,
"logits/chosen": -2.755722761154175,
"logits/rejected": -2.7322795391082764,
"logps/chosen": -201.41317749023438,
"logps/rejected": -173.2834014892578,
"loss": 0.6873,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.041012976318597794,
"rewards/margins": 0.010555104352533817,
"rewards/rejected": 0.03045787289738655,
"step": 7780
},
{
"epoch": 1.36,
"learning_rate": 6.151133501259445e-08,
"logits/chosen": -2.802394390106201,
"logits/rejected": -2.768019676208496,
"logps/chosen": -194.97853088378906,
"logps/rejected": -155.97921752929688,
"loss": 0.688,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03568575531244278,
"rewards/margins": 0.010065983049571514,
"rewards/rejected": 0.02561977133154869,
"step": 7790
},
{
"epoch": 1.37,
"learning_rate": 6.14609571788413e-08,
"logits/chosen": -2.8079912662506104,
"logits/rejected": -2.8577840328216553,
"logps/chosen": -259.79791259765625,
"logps/rejected": -228.3444366455078,
"loss": 0.6892,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.04476379603147507,
"rewards/margins": 0.0020954939536750317,
"rewards/rejected": 0.04266830533742905,
"step": 7800
},
{
"epoch": 1.37,
"learning_rate": 6.141057934508816e-08,
"logits/chosen": -2.6792571544647217,
"logits/rejected": -2.672581195831299,
"logps/chosen": -195.576416015625,
"logps/rejected": -212.009033203125,
"loss": 0.6878,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.031648848205804825,
"rewards/margins": -0.004404547158628702,
"rewards/rejected": 0.03605339676141739,
"step": 7810
},
{
"epoch": 1.37,
"learning_rate": 6.136020151133501e-08,
"logits/chosen": -2.752152681350708,
"logits/rejected": -2.6936943531036377,
"logps/chosen": -199.6970977783203,
"logps/rejected": -192.76779174804688,
"loss": 0.6888,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03685902804136276,
"rewards/margins": 0.012366501614451408,
"rewards/rejected": 0.024492528289556503,
"step": 7820
},
{
"epoch": 1.37,
"learning_rate": 6.130982367758187e-08,
"logits/chosen": -2.7500405311584473,
"logits/rejected": -2.7712624073028564,
"logps/chosen": -225.90231323242188,
"logps/rejected": -223.07925415039062,
"loss": 0.6887,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.04552388936281204,
"rewards/margins": 0.004638020880520344,
"rewards/rejected": 0.04088587313890457,
"step": 7830
},
{
"epoch": 1.37,
"learning_rate": 6.125944584382872e-08,
"logits/chosen": -2.759676218032837,
"logits/rejected": -2.7632689476013184,
"logps/chosen": -265.64593505859375,
"logps/rejected": -209.3302459716797,
"loss": 0.6883,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.04995828866958618,
"rewards/margins": 0.014445647597312927,
"rewards/rejected": 0.035512641072273254,
"step": 7840
},
{
"epoch": 1.38,
"learning_rate": 6.120906801007556e-08,
"logits/chosen": -2.7992868423461914,
"logits/rejected": -2.786892890930176,
"logps/chosen": -246.7543182373047,
"logps/rejected": -220.26803588867188,
"loss": 0.69,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.04133310541510582,
"rewards/margins": 0.005543719045817852,
"rewards/rejected": 0.03578938916325569,
"step": 7850
},
{
"epoch": 1.38,
"learning_rate": 6.115869017632241e-08,
"logits/chosen": -2.7453935146331787,
"logits/rejected": -2.8089358806610107,
"logps/chosen": -205.07772827148438,
"logps/rejected": -183.50558471679688,
"loss": 0.6874,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.034324247390031815,
"rewards/margins": 0.010133923031389713,
"rewards/rejected": 0.024190323427319527,
"step": 7860
},
{
"epoch": 1.38,
"learning_rate": 6.110831234256927e-08,
"logits/chosen": -2.785832166671753,
"logits/rejected": -2.8203999996185303,
"logps/chosen": -229.1759033203125,
"logps/rejected": -201.36029052734375,
"loss": 0.6897,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.04147273674607277,
"rewards/margins": 0.00905263889580965,
"rewards/rejected": 0.032420095056295395,
"step": 7870
},
{
"epoch": 1.38,
"learning_rate": 6.105793450881612e-08,
"logits/chosen": -2.708287000656128,
"logits/rejected": -2.7692911624908447,
"logps/chosen": -221.4902801513672,
"logps/rejected": -197.06146240234375,
"loss": 0.688,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.04135482385754585,
"rewards/margins": 0.010591486468911171,
"rewards/rejected": 0.030763333663344383,
"step": 7880
},
{
"epoch": 1.38,
"learning_rate": 6.100755667506296e-08,
"logits/chosen": -2.724555253982544,
"logits/rejected": -2.7219367027282715,
"logps/chosen": -177.3289337158203,
"logps/rejected": -170.86984252929688,
"loss": 0.6896,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.031236102804541588,
"rewards/margins": 0.005766207817941904,
"rewards/rejected": 0.025469893589615822,
"step": 7890
},
{
"epoch": 1.38,
"learning_rate": 6.095717884130982e-08,
"logits/chosen": -2.713719367980957,
"logits/rejected": -2.7233357429504395,
"logps/chosen": -233.9386749267578,
"logps/rejected": -172.72366333007812,
"loss": 0.6905,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.045443419367074966,
"rewards/margins": 0.016218410804867744,
"rewards/rejected": 0.02922501601278782,
"step": 7900
},
{
"epoch": 1.39,
"learning_rate": 6.090680100755667e-08,
"logits/chosen": -2.775986433029175,
"logits/rejected": -2.727430582046509,
"logps/chosen": -224.6809844970703,
"logps/rejected": -196.10922241210938,
"loss": 0.6887,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03934579715132713,
"rewards/margins": 0.008914479985833168,
"rewards/rejected": 0.030431320890784264,
"step": 7910
},
{
"epoch": 1.39,
"learning_rate": 6.085642317380352e-08,
"logits/chosen": -2.781262159347534,
"logits/rejected": -2.7013962268829346,
"logps/chosen": -210.90963745117188,
"logps/rejected": -203.32460021972656,
"loss": 0.6883,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.033894848078489304,
"rewards/margins": 0.0063673751428723335,
"rewards/rejected": 0.027527472004294395,
"step": 7920
},
{
"epoch": 1.39,
"learning_rate": 6.080604534005038e-08,
"logits/chosen": -2.781320095062256,
"logits/rejected": -2.7733845710754395,
"logps/chosen": -240.52676391601562,
"logps/rejected": -226.217041015625,
"loss": 0.6893,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.04577254876494408,
"rewards/margins": 0.007031611166894436,
"rewards/rejected": 0.038740936666727066,
"step": 7930
},
{
"epoch": 1.39,
"learning_rate": 6.075566750629723e-08,
"logits/chosen": -2.7862772941589355,
"logits/rejected": -2.7734897136688232,
"logps/chosen": -232.9326934814453,
"logps/rejected": -199.85308837890625,
"loss": 0.6887,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.037640467286109924,
"rewards/margins": 0.00660460302606225,
"rewards/rejected": 0.03103586472570896,
"step": 7940
},
{
"epoch": 1.39,
"learning_rate": 6.070528967254408e-08,
"logits/chosen": -2.747159481048584,
"logits/rejected": -2.6515073776245117,
"logps/chosen": -235.05618286132812,
"logps/rejected": -231.2899932861328,
"loss": 0.6873,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.05150740593671799,
"rewards/margins": 0.015792617574334145,
"rewards/rejected": 0.03571479022502899,
"step": 7950
},
{
"epoch": 1.39,
"learning_rate": 6.065491183879094e-08,
"logits/chosen": -2.6942429542541504,
"logits/rejected": -2.7198643684387207,
"logps/chosen": -248.2423553466797,
"logps/rejected": -197.20497131347656,
"loss": 0.6894,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.04131951555609703,
"rewards/margins": 0.014284191653132439,
"rewards/rejected": 0.027035322040319443,
"step": 7960
},
{
"epoch": 1.4,
"learning_rate": 6.060453400503778e-08,
"logits/chosen": -2.7588915824890137,
"logits/rejected": -2.7787914276123047,
"logps/chosen": -242.1793975830078,
"logps/rejected": -204.95382690429688,
"loss": 0.6909,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.051094651222229004,
"rewards/margins": 0.0132598876953125,
"rewards/rejected": 0.037834759801626205,
"step": 7970
},
{
"epoch": 1.4,
"learning_rate": 6.055415617128463e-08,
"logits/chosen": -2.749837636947632,
"logits/rejected": -2.7630608081817627,
"logps/chosen": -258.34930419921875,
"logps/rejected": -182.1297607421875,
"loss": 0.6851,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": 0.04587540775537491,
"rewards/margins": 0.02240714430809021,
"rewards/rejected": 0.02346826158463955,
"step": 7980
},
{
"epoch": 1.4,
"learning_rate": 6.050377833753148e-08,
"logits/chosen": -2.76625919342041,
"logits/rejected": -2.7197346687316895,
"logps/chosen": -210.4891815185547,
"logps/rejected": -174.40744018554688,
"loss": 0.6865,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.04220408946275711,
"rewards/margins": 0.014574876055121422,
"rewards/rejected": 0.027629217132925987,
"step": 7990
},
{
"epoch": 1.4,
"learning_rate": 6.045340050377834e-08,
"logits/chosen": -2.7272531986236572,
"logits/rejected": -2.7292728424072266,
"logps/chosen": -224.6431427001953,
"logps/rejected": -181.2040557861328,
"loss": 0.6889,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.037466295063495636,
"rewards/margins": 0.013241834938526154,
"rewards/rejected": 0.024224456399679184,
"step": 8000
},
{
"epoch": 1.4,
"learning_rate": 6.040302267002518e-08,
"logits/chosen": -2.7375807762145996,
"logits/rejected": -2.7324814796447754,
"logps/chosen": -239.2186279296875,
"logps/rejected": -223.94253540039062,
"loss": 0.6891,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.051830459386110306,
"rewards/margins": 0.01332320086658001,
"rewards/rejected": 0.03850725665688515,
"step": 8010
},
{
"epoch": 1.4,
"learning_rate": 6.035264483627203e-08,
"logits/chosen": -2.787344217300415,
"logits/rejected": -2.757755756378174,
"logps/chosen": -214.58969116210938,
"logps/rejected": -212.26815795898438,
"loss": 0.6884,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.03871138021349907,
"rewards/margins": 0.001409774413332343,
"rewards/rejected": 0.03730160370469093,
"step": 8020
},
{
"epoch": 1.41,
"learning_rate": 6.030226700251889e-08,
"logits/chosen": -2.788583755493164,
"logits/rejected": -2.8225603103637695,
"logps/chosen": -299.5536193847656,
"logps/rejected": -207.89358520507812,
"loss": 0.6885,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.050768353044986725,
"rewards/margins": 0.012225328013300896,
"rewards/rejected": 0.03854302689433098,
"step": 8030
},
{
"epoch": 1.41,
"learning_rate": 6.025188916876574e-08,
"logits/chosen": -2.7606899738311768,
"logits/rejected": -2.760101079940796,
"logps/chosen": -203.7574920654297,
"logps/rejected": -188.63735961914062,
"loss": 0.6875,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03621258586645126,
"rewards/margins": 0.00680736918002367,
"rewards/rejected": 0.029405217617750168,
"step": 8040
},
{
"epoch": 1.41,
"learning_rate": 6.020151133501259e-08,
"logits/chosen": -2.7922425270080566,
"logits/rejected": -2.77087664604187,
"logps/chosen": -264.730712890625,
"logps/rejected": -229.2702178955078,
"loss": 0.6894,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.04078766703605652,
"rewards/margins": 0.005166265182197094,
"rewards/rejected": 0.03562140464782715,
"step": 8050
},
{
"epoch": 1.41,
"learning_rate": 6.015113350125945e-08,
"logits/chosen": -2.6650726795196533,
"logits/rejected": -2.699510335922241,
"logps/chosen": -241.74951171875,
"logps/rejected": -217.79312133789062,
"loss": 0.6895,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.04188552126288414,
"rewards/margins": -0.0013723727315664291,
"rewards/rejected": 0.04325789585709572,
"step": 8060
},
{
"epoch": 1.41,
"learning_rate": 6.01007556675063e-08,
"logits/chosen": -2.6361894607543945,
"logits/rejected": -2.804050922393799,
"logps/chosen": -209.30386352539062,
"logps/rejected": -223.2210693359375,
"loss": 0.6911,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.039837904274463654,
"rewards/margins": 0.003762881737202406,
"rewards/rejected": 0.03607501834630966,
"step": 8070
},
{
"epoch": 1.42,
"learning_rate": 6.005037783375314e-08,
"logits/chosen": -2.715277671813965,
"logits/rejected": -2.7054569721221924,
"logps/chosen": -249.8915557861328,
"logps/rejected": -224.6490020751953,
"loss": 0.6887,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.042900118976831436,
"rewards/margins": 0.008957276120781898,
"rewards/rejected": 0.03394284099340439,
"step": 8080
},
{
"epoch": 1.42,
"learning_rate": 6e-08,
"logits/chosen": -2.749920606613159,
"logits/rejected": -2.6681249141693115,
"logps/chosen": -262.42718505859375,
"logps/rejected": -270.71026611328125,
"loss": 0.6896,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.05033283308148384,
"rewards/margins": 0.003699377877637744,
"rewards/rejected": 0.04663345217704773,
"step": 8090
},
{
"epoch": 1.42,
"learning_rate": 5.994962216624685e-08,
"logits/chosen": -2.699763536453247,
"logits/rejected": -2.7738709449768066,
"logps/chosen": -254.59536743164062,
"logps/rejected": -225.08261108398438,
"loss": 0.6882,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.050733782351017,
"rewards/margins": 0.01060875691473484,
"rewards/rejected": 0.04012501984834671,
"step": 8100
},
{
"epoch": 1.42,
"learning_rate": 5.98992443324937e-08,
"logits/chosen": -2.791287899017334,
"logits/rejected": -2.747755765914917,
"logps/chosen": -200.8659210205078,
"logps/rejected": -184.97738647460938,
"loss": 0.6883,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03486446663737297,
"rewards/margins": 0.002834696788340807,
"rewards/rejected": 0.03202977031469345,
"step": 8110
},
{
"epoch": 1.42,
"learning_rate": 5.984886649874054e-08,
"logits/chosen": -2.6940653324127197,
"logits/rejected": -2.760707139968872,
"logps/chosen": -228.6831817626953,
"logps/rejected": -221.67361450195312,
"loss": 0.6887,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.04749389737844467,
"rewards/margins": 0.011963879689574242,
"rewards/rejected": 0.03553002327680588,
"step": 8120
},
{
"epoch": 1.42,
"learning_rate": 5.97984886649874e-08,
"logits/chosen": -2.7091734409332275,
"logits/rejected": -2.727992534637451,
"logps/chosen": -204.9541015625,
"logps/rejected": -178.6293487548828,
"loss": 0.6887,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0264905896037817,
"rewards/margins": 0.0013065729290246964,
"rewards/rejected": 0.025184014812111855,
"step": 8130
},
{
"epoch": 1.43,
"learning_rate": 5.974811083123425e-08,
"logits/chosen": -2.7273199558258057,
"logits/rejected": -2.7602429389953613,
"logps/chosen": -236.5217742919922,
"logps/rejected": -218.5023193359375,
"loss": 0.6888,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04743615910410881,
"rewards/margins": 0.007979987189173698,
"rewards/rejected": 0.03945617750287056,
"step": 8140
},
{
"epoch": 1.43,
"learning_rate": 5.96977329974811e-08,
"logits/chosen": -2.7114429473876953,
"logits/rejected": -2.7514827251434326,
"logps/chosen": -233.47323608398438,
"logps/rejected": -183.81675720214844,
"loss": 0.6869,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.046855200082063675,
"rewards/margins": 0.016597609966993332,
"rewards/rejected": 0.030257591977715492,
"step": 8150
},
{
"epoch": 1.43,
"learning_rate": 5.964735516372796e-08,
"logits/chosen": -2.7446465492248535,
"logits/rejected": -2.6851656436920166,
"logps/chosen": -206.99264526367188,
"logps/rejected": -168.73605346679688,
"loss": 0.6876,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03506845980882645,
"rewards/margins": 0.014280231669545174,
"rewards/rejected": 0.02078823372721672,
"step": 8160
},
{
"epoch": 1.43,
"learning_rate": 5.9596977329974804e-08,
"logits/chosen": -2.819230794906616,
"logits/rejected": -2.7767491340637207,
"logps/chosen": -244.1392059326172,
"logps/rejected": -208.48880004882812,
"loss": 0.6895,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.057758230715990067,
"rewards/margins": 0.0185552891343832,
"rewards/rejected": 0.039202939718961716,
"step": 8170
},
{
"epoch": 1.43,
"learning_rate": 5.9546599496221664e-08,
"logits/chosen": -2.7350716590881348,
"logits/rejected": -2.6791672706604004,
"logps/chosen": -200.4189910888672,
"logps/rejected": -196.80860900878906,
"loss": 0.6887,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.034190356731414795,
"rewards/margins": 0.00776415690779686,
"rewards/rejected": 0.026426201686263084,
"step": 8180
},
{
"epoch": 1.43,
"learning_rate": 5.949622166246852e-08,
"logits/chosen": -2.7582621574401855,
"logits/rejected": -2.7618229389190674,
"logps/chosen": -180.63294982910156,
"logps/rejected": -157.079833984375,
"loss": 0.6901,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.03690091520547867,
"rewards/margins": 0.011395210400223732,
"rewards/rejected": 0.025505702942609787,
"step": 8190
},
{
"epoch": 1.44,
"learning_rate": 5.944584382871536e-08,
"logits/chosen": -2.731879472732544,
"logits/rejected": -2.7573390007019043,
"logps/chosen": -210.488525390625,
"logps/rejected": -197.1478271484375,
"loss": 0.6868,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.047597721219062805,
"rewards/margins": 0.010359442792832851,
"rewards/rejected": 0.03723827749490738,
"step": 8200
},
{
"epoch": 1.44,
"learning_rate": 5.939546599496221e-08,
"logits/chosen": -2.7964818477630615,
"logits/rejected": -2.7716190814971924,
"logps/chosen": -220.36572265625,
"logps/rejected": -191.2345428466797,
"loss": 0.69,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.048532258719205856,
"rewards/margins": 0.012116949073970318,
"rewards/rejected": 0.03641531243920326,
"step": 8210
},
{
"epoch": 1.44,
"learning_rate": 5.9345088161209065e-08,
"logits/chosen": -2.768618106842041,
"logits/rejected": -2.745877265930176,
"logps/chosen": -241.71826171875,
"logps/rejected": -231.50302124023438,
"loss": 0.6923,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.04764752835035324,
"rewards/margins": 0.003467456204816699,
"rewards/rejected": 0.04418007284402847,
"step": 8220
},
{
"epoch": 1.44,
"learning_rate": 5.929471032745592e-08,
"logits/chosen": -2.7671141624450684,
"logits/rejected": -2.7717056274414062,
"logps/chosen": -282.21734619140625,
"logps/rejected": -230.12704467773438,
"loss": 0.689,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.05740467458963394,
"rewards/margins": 0.02093067206442356,
"rewards/rejected": 0.03647400066256523,
"step": 8230
},
{
"epoch": 1.44,
"learning_rate": 5.9244332493702766e-08,
"logits/chosen": -2.7785863876342773,
"logits/rejected": -2.7596054077148438,
"logps/chosen": -269.4919128417969,
"logps/rejected": -206.0177459716797,
"loss": 0.6885,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.04548025503754616,
"rewards/margins": 0.017482586205005646,
"rewards/rejected": 0.02799767255783081,
"step": 8240
},
{
"epoch": 1.45,
"learning_rate": 5.919395465994962e-08,
"logits/chosen": -2.6811938285827637,
"logits/rejected": -2.731386184692383,
"logps/chosen": -189.69949340820312,
"logps/rejected": -172.76312255859375,
"loss": 0.687,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.038950253278017044,
"rewards/margins": 0.009141791611909866,
"rewards/rejected": 0.029808461666107178,
"step": 8250
},
{
"epoch": 1.45,
"learning_rate": 5.9143576826196473e-08,
"logits/chosen": -2.67179536819458,
"logits/rejected": -2.7431387901306152,
"logps/chosen": -238.79928588867188,
"logps/rejected": -197.96249389648438,
"loss": 0.6887,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.04331899806857109,
"rewards/margins": 0.00855275709182024,
"rewards/rejected": 0.03476623818278313,
"step": 8260
},
{
"epoch": 1.45,
"learning_rate": 5.909319899244333e-08,
"logits/chosen": -2.6874778270721436,
"logits/rejected": -2.7527995109558105,
"logps/chosen": -265.18646240234375,
"logps/rejected": -254.72055053710938,
"loss": 0.6902,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.04799005389213562,
"rewards/margins": 0.008365727961063385,
"rewards/rejected": 0.03962433338165283,
"step": 8270
},
{
"epoch": 1.45,
"learning_rate": 5.904282115869017e-08,
"logits/chosen": -2.775963068008423,
"logits/rejected": -2.7594003677368164,
"logps/chosen": -193.80345153808594,
"logps/rejected": -182.29696655273438,
"loss": 0.6904,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03241405636072159,
"rewards/margins": 0.0072534880600869656,
"rewards/rejected": 0.025160569697618484,
"step": 8280
},
{
"epoch": 1.45,
"learning_rate": 5.899244332493703e-08,
"logits/chosen": -2.7540886402130127,
"logits/rejected": -2.7759768962860107,
"logps/chosen": -256.3172912597656,
"logps/rejected": -248.9473114013672,
"loss": 0.6896,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.04200480133295059,
"rewards/margins": 0.005136861000210047,
"rewards/rejected": 0.03686793893575668,
"step": 8290
},
{
"epoch": 1.45,
"learning_rate": 5.894206549118388e-08,
"logits/chosen": -2.7550156116485596,
"logits/rejected": -2.8021984100341797,
"logps/chosen": -229.73519897460938,
"logps/rejected": -194.55474853515625,
"loss": 0.6892,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.040971461683511734,
"rewards/margins": 0.007404597010463476,
"rewards/rejected": 0.03356685861945152,
"step": 8300
},
{
"epoch": 1.46,
"learning_rate": 5.8891687657430735e-08,
"logits/chosen": -2.7880303859710693,
"logits/rejected": -2.7363808155059814,
"logps/chosen": -173.42591857910156,
"logps/rejected": -178.16490173339844,
"loss": 0.6883,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.03242052346467972,
"rewards/margins": 0.0012834550580009818,
"rewards/rejected": 0.03113706409931183,
"step": 8310
},
{
"epoch": 1.46,
"learning_rate": 5.8841309823677575e-08,
"logits/chosen": -2.7852296829223633,
"logits/rejected": -2.732570171356201,
"logps/chosen": -205.2123260498047,
"logps/rejected": -221.46542358398438,
"loss": 0.6887,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.037264786660671234,
"rewards/margins": -0.0015946425264701247,
"rewards/rejected": 0.038859423249959946,
"step": 8320
},
{
"epoch": 1.46,
"learning_rate": 5.879093198992443e-08,
"logits/chosen": -2.7393336296081543,
"logits/rejected": -2.750638484954834,
"logps/chosen": -200.95550537109375,
"logps/rejected": -182.22824096679688,
"loss": 0.6876,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03504057973623276,
"rewards/margins": 0.0032831882126629353,
"rewards/rejected": 0.03175738826394081,
"step": 8330
},
{
"epoch": 1.46,
"learning_rate": 5.874055415617128e-08,
"logits/chosen": -2.733309268951416,
"logits/rejected": -2.7839436531066895,
"logps/chosen": -209.6042022705078,
"logps/rejected": -167.40438842773438,
"loss": 0.6877,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.03753194957971573,
"rewards/margins": 0.0077357119880616665,
"rewards/rejected": 0.029796237125992775,
"step": 8340
},
{
"epoch": 1.46,
"learning_rate": 5.869017632241813e-08,
"logits/chosen": -2.8055219650268555,
"logits/rejected": -2.817014694213867,
"logps/chosen": -208.11178588867188,
"logps/rejected": -204.49551391601562,
"loss": 0.6887,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.036422837525606155,
"rewards/margins": 0.003470013616606593,
"rewards/rejected": 0.032952822744846344,
"step": 8350
},
{
"epoch": 1.46,
"learning_rate": 5.863979848866498e-08,
"logits/chosen": -2.8599841594696045,
"logits/rejected": -2.8321750164031982,
"logps/chosen": -245.27285766601562,
"logps/rejected": -233.36593627929688,
"loss": 0.689,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.045193519443273544,
"rewards/margins": 0.0070549556985497475,
"rewards/rejected": 0.03813857212662697,
"step": 8360
},
{
"epoch": 1.47,
"learning_rate": 5.858942065491184e-08,
"logits/chosen": -2.711230516433716,
"logits/rejected": -2.7263026237487793,
"logps/chosen": -247.5156707763672,
"logps/rejected": -204.61376953125,
"loss": 0.6859,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.06073460727930069,
"rewards/margins": 0.02463601343333721,
"rewards/rejected": 0.03609859198331833,
"step": 8370
},
{
"epoch": 1.47,
"learning_rate": 5.853904282115869e-08,
"logits/chosen": -2.771897315979004,
"logits/rejected": -2.770329713821411,
"logps/chosen": -261.06951904296875,
"logps/rejected": -264.5949401855469,
"loss": 0.6905,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.051393140107393265,
"rewards/margins": 0.006638474762439728,
"rewards/rejected": 0.04475466161966324,
"step": 8380
},
{
"epoch": 1.47,
"learning_rate": 5.848866498740553e-08,
"logits/chosen": -2.7597389221191406,
"logits/rejected": -2.7436418533325195,
"logps/chosen": -245.485595703125,
"logps/rejected": -207.4766845703125,
"loss": 0.6878,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.051292382180690765,
"rewards/margins": 0.012479810044169426,
"rewards/rejected": 0.03881257027387619,
"step": 8390
},
{
"epoch": 1.47,
"learning_rate": 5.843828715365239e-08,
"logits/chosen": -2.80478572845459,
"logits/rejected": -2.771780490875244,
"logps/chosen": -204.68588256835938,
"logps/rejected": -193.27899169921875,
"loss": 0.6904,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04538872465491295,
"rewards/margins": 0.008817224763333797,
"rewards/rejected": 0.03657149896025658,
"step": 8400
},
{
"epoch": 1.47,
"learning_rate": 5.8387909319899245e-08,
"logits/chosen": -2.7240943908691406,
"logits/rejected": -2.806950569152832,
"logps/chosen": -256.45501708984375,
"logps/rejected": -257.5248718261719,
"loss": 0.6887,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.056347597390413284,
"rewards/margins": 0.006222080439329147,
"rewards/rejected": 0.05012550950050354,
"step": 8410
},
{
"epoch": 1.47,
"learning_rate": 5.83375314861461e-08,
"logits/chosen": -2.7173569202423096,
"logits/rejected": -2.7189526557922363,
"logps/chosen": -238.66342163085938,
"logps/rejected": -196.93142700195312,
"loss": 0.6873,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.046293385326862335,
"rewards/margins": 0.011984572745859623,
"rewards/rejected": 0.03430881351232529,
"step": 8420
},
{
"epoch": 1.48,
"learning_rate": 5.828715365239294e-08,
"logits/chosen": -2.821493148803711,
"logits/rejected": -2.864586591720581,
"logps/chosen": -195.20623779296875,
"logps/rejected": -215.08755493164062,
"loss": 0.6894,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.038646843284368515,
"rewards/margins": 0.004198746755719185,
"rewards/rejected": 0.03444809466600418,
"step": 8430
},
{
"epoch": 1.48,
"learning_rate": 5.823677581863979e-08,
"logits/chosen": -2.680703639984131,
"logits/rejected": -2.7536604404449463,
"logps/chosen": -219.0048828125,
"logps/rejected": -202.65245056152344,
"loss": 0.6898,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.042999859899282455,
"rewards/margins": 0.009765975177288055,
"rewards/rejected": 0.0332338847219944,
"step": 8440
},
{
"epoch": 1.48,
"learning_rate": 5.8186397984886646e-08,
"logits/chosen": -2.7437472343444824,
"logits/rejected": -2.7347023487091064,
"logps/chosen": -196.41883850097656,
"logps/rejected": -166.17236328125,
"loss": 0.6883,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03196621313691139,
"rewards/margins": 0.008594868704676628,
"rewards/rejected": 0.023371344432234764,
"step": 8450
},
{
"epoch": 1.48,
"learning_rate": 5.81360201511335e-08,
"logits/chosen": -2.737215518951416,
"logits/rejected": -2.731224536895752,
"logps/chosen": -232.0885772705078,
"logps/rejected": -181.93997192382812,
"loss": 0.6881,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.041482407599687576,
"rewards/margins": 0.011339427903294563,
"rewards/rejected": 0.030142977833747864,
"step": 8460
},
{
"epoch": 1.48,
"learning_rate": 5.808564231738035e-08,
"logits/chosen": -2.743090867996216,
"logits/rejected": -2.6777594089508057,
"logps/chosen": -185.24954223632812,
"logps/rejected": -203.14199829101562,
"loss": 0.6897,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.02936091460287571,
"rewards/margins": 0.0038882705848664045,
"rewards/rejected": 0.025472644716501236,
"step": 8470
},
{
"epoch": 1.49,
"learning_rate": 5.80352644836272e-08,
"logits/chosen": -2.778669595718384,
"logits/rejected": -2.7191758155822754,
"logps/chosen": -235.8621063232422,
"logps/rejected": -230.335205078125,
"loss": 0.6885,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.03947572037577629,
"rewards/margins": 0.003947444260120392,
"rewards/rejected": 0.0355282798409462,
"step": 8480
},
{
"epoch": 1.49,
"learning_rate": 5.7984886649874054e-08,
"logits/chosen": -2.7726998329162598,
"logits/rejected": -2.8148016929626465,
"logps/chosen": -250.29202270507812,
"logps/rejected": -219.3681182861328,
"loss": 0.6879,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.05604994297027588,
"rewards/margins": 0.015362827107310295,
"rewards/rejected": 0.040687110275030136,
"step": 8490
},
{
"epoch": 1.49,
"learning_rate": 5.793450881612091e-08,
"logits/chosen": -2.778038740158081,
"logits/rejected": -2.7753331661224365,
"logps/chosen": -206.3338623046875,
"logps/rejected": -184.36129760742188,
"loss": 0.6886,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03952028229832649,
"rewards/margins": 0.009847410954535007,
"rewards/rejected": 0.029672876000404358,
"step": 8500
},
{
"epoch": 1.49,
"learning_rate": 5.7884130982367755e-08,
"logits/chosen": -2.7196013927459717,
"logits/rejected": -2.8112895488739014,
"logps/chosen": -204.50921630859375,
"logps/rejected": -174.06558227539062,
"loss": 0.6882,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04074891284108162,
"rewards/margins": 0.0165697168558836,
"rewards/rejected": 0.02417919412255287,
"step": 8510
},
{
"epoch": 1.49,
"learning_rate": 5.783375314861461e-08,
"logits/chosen": -2.7498068809509277,
"logits/rejected": -2.757819414138794,
"logps/chosen": -201.4228057861328,
"logps/rejected": -219.12399291992188,
"loss": 0.6885,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.037325937300920486,
"rewards/margins": -0.0009258370846509933,
"rewards/rejected": 0.03825177252292633,
"step": 8520
},
{
"epoch": 1.49,
"learning_rate": 5.778337531486146e-08,
"logits/chosen": -2.7941741943359375,
"logits/rejected": -2.7413251399993896,
"logps/chosen": -224.0157012939453,
"logps/rejected": -202.8053436279297,
"loss": 0.6884,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04527192562818527,
"rewards/margins": 0.014141691848635674,
"rewards/rejected": 0.031130235642194748,
"step": 8530
},
{
"epoch": 1.5,
"learning_rate": 5.7732997481108316e-08,
"logits/chosen": -2.8099892139434814,
"logits/rejected": -2.757983684539795,
"logps/chosen": -243.79086303710938,
"logps/rejected": -223.33932495117188,
"loss": 0.6898,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.04493292048573494,
"rewards/margins": 0.0019141886150464416,
"rewards/rejected": 0.04301873594522476,
"step": 8540
},
{
"epoch": 1.5,
"learning_rate": 5.7682619647355156e-08,
"logits/chosen": -2.784567356109619,
"logits/rejected": -2.7672345638275146,
"logps/chosen": -235.2530059814453,
"logps/rejected": -210.9793701171875,
"loss": 0.6881,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.05156296491622925,
"rewards/margins": 0.007609918713569641,
"rewards/rejected": 0.043953049927949905,
"step": 8550
},
{
"epoch": 1.5,
"learning_rate": 5.763224181360201e-08,
"logits/chosen": -2.818497896194458,
"logits/rejected": -2.760577440261841,
"logps/chosen": -234.3348388671875,
"logps/rejected": -193.94863891601562,
"loss": 0.6871,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.05081092566251755,
"rewards/margins": 0.01714308187365532,
"rewards/rejected": 0.03366784378886223,
"step": 8560
},
{
"epoch": 1.5,
"learning_rate": 5.758186397984886e-08,
"logits/chosen": -2.7838993072509766,
"logits/rejected": -2.7389278411865234,
"logps/chosen": -220.52511596679688,
"logps/rejected": -211.15255737304688,
"loss": 0.6888,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.035474494099617004,
"rewards/margins": -0.0008419624646194279,
"rewards/rejected": 0.03631645813584328,
"step": 8570
},
{
"epoch": 1.5,
"learning_rate": 5.753148614609572e-08,
"logits/chosen": -2.788435459136963,
"logits/rejected": -2.7799055576324463,
"logps/chosen": -216.87448120117188,
"logps/rejected": -198.84854125976562,
"loss": 0.6883,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.038950562477111816,
"rewards/margins": 0.015099948272109032,
"rewards/rejected": 0.023850608617067337,
"step": 8580
},
{
"epoch": 1.5,
"learning_rate": 5.7481108312342564e-08,
"logits/chosen": -2.7052228450775146,
"logits/rejected": -2.6766791343688965,
"logps/chosen": -183.8777618408203,
"logps/rejected": -182.99578857421875,
"loss": 0.6892,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04428397864103317,
"rewards/margins": 0.010991683229804039,
"rewards/rejected": 0.03329230099916458,
"step": 8590
},
{
"epoch": 1.51,
"learning_rate": 5.743073047858942e-08,
"logits/chosen": -2.815370559692383,
"logits/rejected": -2.7483325004577637,
"logps/chosen": -202.84475708007812,
"logps/rejected": -165.16668701171875,
"loss": 0.6854,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.045902546495199203,
"rewards/margins": 0.022786486893892288,
"rewards/rejected": 0.023116057738661766,
"step": 8600
},
{
"epoch": 1.51,
"learning_rate": 5.738035264483627e-08,
"logits/chosen": -2.7344138622283936,
"logits/rejected": -2.7439301013946533,
"logps/chosen": -226.06161499023438,
"logps/rejected": -174.56552124023438,
"loss": 0.6868,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.039994433522224426,
"rewards/margins": 0.020141465589404106,
"rewards/rejected": 0.01985296607017517,
"step": 8610
},
{
"epoch": 1.51,
"learning_rate": 5.7329974811083125e-08,
"logits/chosen": -2.8340532779693604,
"logits/rejected": -2.7644944190979004,
"logps/chosen": -207.7313690185547,
"logps/rejected": -182.41390991210938,
"loss": 0.6868,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.03946467861533165,
"rewards/margins": 0.01365002989768982,
"rewards/rejected": 0.02581464685499668,
"step": 8620
},
{
"epoch": 1.51,
"learning_rate": 5.727959697732997e-08,
"logits/chosen": -2.798107624053955,
"logits/rejected": -2.7637317180633545,
"logps/chosen": -257.6904296875,
"logps/rejected": -244.3838348388672,
"loss": 0.6882,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04575506970286369,
"rewards/margins": 0.006212930660694838,
"rewards/rejected": 0.03954214230179787,
"step": 8630
},
{
"epoch": 1.51,
"learning_rate": 5.7229219143576825e-08,
"logits/chosen": -2.7994701862335205,
"logits/rejected": -2.774688959121704,
"logps/chosen": -220.4487762451172,
"logps/rejected": -172.90780639648438,
"loss": 0.6893,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.043639928102493286,
"rewards/margins": 0.01047286856919527,
"rewards/rejected": 0.03316705673933029,
"step": 8640
},
{
"epoch": 1.52,
"learning_rate": 5.717884130982368e-08,
"logits/chosen": -2.764247417449951,
"logits/rejected": -2.743495464324951,
"logps/chosen": -239.54025268554688,
"logps/rejected": -214.3405303955078,
"loss": 0.6875,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03702837601304054,
"rewards/margins": 0.012995190918445587,
"rewards/rejected": 0.024033186957240105,
"step": 8650
},
{
"epoch": 1.52,
"learning_rate": 5.712846347607052e-08,
"logits/chosen": -2.7130041122436523,
"logits/rejected": -2.7699601650238037,
"logps/chosen": -237.2503204345703,
"logps/rejected": -185.75486755371094,
"loss": 0.6877,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.04563732072710991,
"rewards/margins": 0.015573574230074883,
"rewards/rejected": 0.030063744634389877,
"step": 8660
},
{
"epoch": 1.52,
"learning_rate": 5.707808564231737e-08,
"logits/chosen": -2.774289608001709,
"logits/rejected": -2.7651114463806152,
"logps/chosen": -269.4395751953125,
"logps/rejected": -211.79531860351562,
"loss": 0.6894,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.05132768303155899,
"rewards/margins": 0.011847235262393951,
"rewards/rejected": 0.039480455219745636,
"step": 8670
},
{
"epoch": 1.52,
"learning_rate": 5.702770780856423e-08,
"logits/chosen": -2.7488410472869873,
"logits/rejected": -2.811511516571045,
"logps/chosen": -230.3901824951172,
"logps/rejected": -180.4424591064453,
"loss": 0.6856,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.05101857706904411,
"rewards/margins": 0.01628846302628517,
"rewards/rejected": 0.03473011404275894,
"step": 8680
},
{
"epoch": 1.52,
"learning_rate": 5.697732997481108e-08,
"logits/chosen": -2.715552568435669,
"logits/rejected": -2.745255947113037,
"logps/chosen": -223.7119903564453,
"logps/rejected": -228.6637725830078,
"loss": 0.6869,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.05288667604327202,
"rewards/margins": 0.007302626967430115,
"rewards/rejected": 0.045584045350551605,
"step": 8690
},
{
"epoch": 1.52,
"learning_rate": 5.692695214105793e-08,
"logits/chosen": -2.757916212081909,
"logits/rejected": -2.6959335803985596,
"logps/chosen": -219.01956176757812,
"logps/rejected": -228.71627807617188,
"loss": 0.6875,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.05256640911102295,
"rewards/margins": 0.006362512707710266,
"rewards/rejected": 0.046203892678022385,
"step": 8700
},
{
"epoch": 1.53,
"learning_rate": 5.687657430730478e-08,
"logits/chosen": -2.8467657566070557,
"logits/rejected": -2.7943410873413086,
"logps/chosen": -219.20028686523438,
"logps/rejected": -235.470703125,
"loss": 0.6871,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.045346882194280624,
"rewards/margins": 0.001881635980680585,
"rewards/rejected": 0.04346524551510811,
"step": 8710
},
{
"epoch": 1.53,
"learning_rate": 5.6826196473551635e-08,
"logits/chosen": -2.8179268836975098,
"logits/rejected": -2.793691396713257,
"logps/chosen": -269.15374755859375,
"logps/rejected": -207.63232421875,
"loss": 0.6889,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.053640447556972504,
"rewards/margins": 0.012012636289000511,
"rewards/rejected": 0.04162780940532684,
"step": 8720
},
{
"epoch": 1.53,
"learning_rate": 5.677581863979849e-08,
"logits/chosen": -2.76914381980896,
"logits/rejected": -2.7731528282165527,
"logps/chosen": -239.4773406982422,
"logps/rejected": -220.02938842773438,
"loss": 0.6883,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.035095784813165665,
"rewards/margins": 0.004083072766661644,
"rewards/rejected": 0.031012708321213722,
"step": 8730
},
{
"epoch": 1.53,
"learning_rate": 5.6725440806045335e-08,
"logits/chosen": -2.8200926780700684,
"logits/rejected": -2.8051130771636963,
"logps/chosen": -225.9854278564453,
"logps/rejected": -199.87562561035156,
"loss": 0.6884,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.04804544523358345,
"rewards/margins": 0.0140976682305336,
"rewards/rejected": 0.03394777700304985,
"step": 8740
},
{
"epoch": 1.53,
"learning_rate": 5.667506297229219e-08,
"logits/chosen": -2.771458625793457,
"logits/rejected": -2.7316102981567383,
"logps/chosen": -198.54049682617188,
"logps/rejected": -189.3423614501953,
"loss": 0.6905,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0411757230758667,
"rewards/margins": 0.005958369933068752,
"rewards/rejected": 0.03521735221147537,
"step": 8750
},
{
"epoch": 1.53,
"learning_rate": 5.662468513853904e-08,
"logits/chosen": -2.7698636054992676,
"logits/rejected": -2.7552199363708496,
"logps/chosen": -229.97537231445312,
"logps/rejected": -203.84976196289062,
"loss": 0.6877,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.05870678275823593,
"rewards/margins": 0.017172252759337425,
"rewards/rejected": 0.04153453931212425,
"step": 8760
},
{
"epoch": 1.54,
"learning_rate": 5.6574307304785896e-08,
"logits/chosen": -2.6863961219787598,
"logits/rejected": -2.6779088973999023,
"logps/chosen": -234.57101440429688,
"logps/rejected": -185.58840942382812,
"loss": 0.6905,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.03976276144385338,
"rewards/margins": 0.00548075046390295,
"rewards/rejected": 0.034282006323337555,
"step": 8770
},
{
"epoch": 1.54,
"learning_rate": 5.6523929471032737e-08,
"logits/chosen": -2.739356517791748,
"logits/rejected": -2.788348436355591,
"logps/chosen": -209.69857788085938,
"logps/rejected": -199.63473510742188,
"loss": 0.6887,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.04317685216665268,
"rewards/margins": 0.006445699837058783,
"rewards/rejected": 0.03673115372657776,
"step": 8780
},
{
"epoch": 1.54,
"learning_rate": 5.647355163727959e-08,
"logits/chosen": -2.7598869800567627,
"logits/rejected": -2.738487482070923,
"logps/chosen": -249.5239715576172,
"logps/rejected": -210.69021606445312,
"loss": 0.6884,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.057052165269851685,
"rewards/margins": 0.014407709240913391,
"rewards/rejected": 0.04264445602893829,
"step": 8790
},
{
"epoch": 1.54,
"learning_rate": 5.6423173803526444e-08,
"logits/chosen": -2.7936174869537354,
"logits/rejected": -2.7623283863067627,
"logps/chosen": -206.39572143554688,
"logps/rejected": -162.04994201660156,
"loss": 0.6899,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.04691698029637337,
"rewards/margins": 0.015475709922611713,
"rewards/rejected": 0.03144126385450363,
"step": 8800
},
{
"epoch": 1.54,
"learning_rate": 5.6372795969773304e-08,
"logits/chosen": -2.7687063217163086,
"logits/rejected": -2.7901759147644043,
"logps/chosen": -271.50201416015625,
"logps/rejected": -216.03878784179688,
"loss": 0.6888,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.05467065051198006,
"rewards/margins": 0.01723630167543888,
"rewards/rejected": 0.03743434697389603,
"step": 8810
},
{
"epoch": 1.54,
"learning_rate": 5.6322418136020145e-08,
"logits/chosen": -2.794313430786133,
"logits/rejected": -2.794102191925049,
"logps/chosen": -233.6994171142578,
"logps/rejected": -184.6134033203125,
"loss": 0.6888,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.03926300257444382,
"rewards/margins": 0.001541120931506157,
"rewards/rejected": 0.03772187978029251,
"step": 8820
},
{
"epoch": 1.55,
"learning_rate": 5.6272040302267e-08,
"logits/chosen": -2.72084641456604,
"logits/rejected": -2.8114678859710693,
"logps/chosen": -229.1598663330078,
"logps/rejected": -197.14385986328125,
"loss": 0.6855,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.04723774269223213,
"rewards/margins": 0.010595154948532581,
"rewards/rejected": 0.036642588675022125,
"step": 8830
},
{
"epoch": 1.55,
"learning_rate": 5.622166246851385e-08,
"logits/chosen": -2.7159905433654785,
"logits/rejected": -2.7547850608825684,
"logps/chosen": -249.0121612548828,
"logps/rejected": -196.9223175048828,
"loss": 0.6863,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.05349539592862129,
"rewards/margins": 0.01618610881268978,
"rewards/rejected": 0.03730928525328636,
"step": 8840
},
{
"epoch": 1.55,
"learning_rate": 5.6171284634760705e-08,
"logits/chosen": -2.724531650543213,
"logits/rejected": -2.7724790573120117,
"logps/chosen": -231.1404571533203,
"logps/rejected": -227.45590209960938,
"loss": 0.689,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.04307236522436142,
"rewards/margins": 0.007877699099481106,
"rewards/rejected": 0.035194672644138336,
"step": 8850
},
{
"epoch": 1.55,
"learning_rate": 5.612090680100755e-08,
"logits/chosen": -2.754436731338501,
"logits/rejected": -2.8007025718688965,
"logps/chosen": -270.7969055175781,
"logps/rejected": -242.35183715820312,
"loss": 0.6872,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.05585699528455734,
"rewards/margins": 0.009231283329427242,
"rewards/rejected": 0.04662570729851723,
"step": 8860
},
{
"epoch": 1.55,
"learning_rate": 5.6070528967254406e-08,
"logits/chosen": -2.6838278770446777,
"logits/rejected": -2.766242265701294,
"logps/chosen": -255.3485565185547,
"logps/rejected": -220.1199188232422,
"loss": 0.6878,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.048295557498931885,
"rewards/margins": 0.009508052840828896,
"rewards/rejected": 0.03878750279545784,
"step": 8870
},
{
"epoch": 1.56,
"learning_rate": 5.602015113350126e-08,
"logits/chosen": -2.7382352352142334,
"logits/rejected": -2.8044495582580566,
"logps/chosen": -244.29153442382812,
"logps/rejected": -218.97097778320312,
"loss": 0.6876,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.05450066179037094,
"rewards/margins": 0.008315160870552063,
"rewards/rejected": 0.04618550091981888,
"step": 8880
},
{
"epoch": 1.56,
"learning_rate": 5.5969773299748113e-08,
"logits/chosen": -2.776350498199463,
"logits/rejected": -2.752664566040039,
"logps/chosen": -235.73233032226562,
"logps/rejected": -208.52737426757812,
"loss": 0.6874,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.04617000371217728,
"rewards/margins": 0.0013287483016029,
"rewards/rejected": 0.044841259717941284,
"step": 8890
},
{
"epoch": 1.56,
"learning_rate": 5.5919395465994954e-08,
"logits/chosen": -2.7392613887786865,
"logits/rejected": -2.756448268890381,
"logps/chosen": -219.9252166748047,
"logps/rejected": -183.68324279785156,
"loss": 0.6877,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.04604010656476021,
"rewards/margins": 0.004281000234186649,
"rewards/rejected": 0.041759099811315536,
"step": 8900
},
{
"epoch": 1.56,
"learning_rate": 5.586901763224181e-08,
"logits/chosen": -2.738739252090454,
"logits/rejected": -2.8169057369232178,
"logps/chosen": -252.9962158203125,
"logps/rejected": -200.0865936279297,
"loss": 0.6885,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.047353629022836685,
"rewards/margins": 0.00408762414008379,
"rewards/rejected": 0.04326600581407547,
"step": 8910
},
{
"epoch": 1.56,
"learning_rate": 5.581863979848867e-08,
"logits/chosen": -2.7649385929107666,
"logits/rejected": -2.733037233352661,
"logps/chosen": -203.55955505371094,
"logps/rejected": -200.595458984375,
"loss": 0.687,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.036483533680438995,
"rewards/margins": 0.010326062329113483,
"rewards/rejected": 0.026157474145293236,
"step": 8920
},
{
"epoch": 1.56,
"learning_rate": 5.576826196473552e-08,
"logits/chosen": -2.7592132091522217,
"logits/rejected": -2.7713820934295654,
"logps/chosen": -292.9085693359375,
"logps/rejected": -248.684814453125,
"loss": 0.6872,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.06435064971446991,
"rewards/margins": 0.020021168515086174,
"rewards/rejected": 0.04432948678731918,
"step": 8930
},
{
"epoch": 1.57,
"learning_rate": 5.571788413098236e-08,
"logits/chosen": -2.779628276824951,
"logits/rejected": -2.7205421924591064,
"logps/chosen": -201.10134887695312,
"logps/rejected": -219.69430541992188,
"loss": 0.6892,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.037483375519514084,
"rewards/margins": 0.004479845520108938,
"rewards/rejected": 0.03300352767109871,
"step": 8940
},
{
"epoch": 1.57,
"learning_rate": 5.5667506297229215e-08,
"logits/chosen": -2.7869956493377686,
"logits/rejected": -2.8030505180358887,
"logps/chosen": -224.43423461914062,
"logps/rejected": -202.8345184326172,
"loss": 0.6873,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.05292726680636406,
"rewards/margins": 0.013693466782569885,
"rewards/rejected": 0.039233800023794174,
"step": 8950
},
{
"epoch": 1.57,
"learning_rate": 5.561712846347607e-08,
"logits/chosen": -2.7221343517303467,
"logits/rejected": -2.7979655265808105,
"logps/chosen": -275.8337707519531,
"logps/rejected": -228.05105590820312,
"loss": 0.6862,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.05333739519119263,
"rewards/margins": 0.012456092052161694,
"rewards/rejected": 0.04088129848241806,
"step": 8960
},
{
"epoch": 1.57,
"learning_rate": 5.556675062972292e-08,
"logits/chosen": -2.7971296310424805,
"logits/rejected": -2.7281224727630615,
"logps/chosen": -217.47689819335938,
"logps/rejected": -214.9822235107422,
"loss": 0.6887,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.04712430015206337,
"rewards/margins": 0.0025797581765800714,
"rewards/rejected": 0.04454454034566879,
"step": 8970
},
{
"epoch": 1.57,
"learning_rate": 5.551637279596977e-08,
"logits/chosen": -2.710780382156372,
"logits/rejected": -2.772583484649658,
"logps/chosen": -215.26107788085938,
"logps/rejected": -197.31336975097656,
"loss": 0.6885,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.04553055018186569,
"rewards/margins": 0.0024104660842567682,
"rewards/rejected": 0.04312007874250412,
"step": 8980
},
{
"epoch": 1.57,
"learning_rate": 5.546599496221662e-08,
"logits/chosen": -2.8027522563934326,
"logits/rejected": -2.8064560890197754,
"logps/chosen": -245.5795135498047,
"logps/rejected": -193.53579711914062,
"loss": 0.6881,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.046005867421627045,
"rewards/margins": 0.012948085553944111,
"rewards/rejected": 0.03305777907371521,
"step": 8990
},
{
"epoch": 1.58,
"learning_rate": 5.541561712846348e-08,
"logits/chosen": -2.7577126026153564,
"logits/rejected": -2.7995660305023193,
"logps/chosen": -224.8982696533203,
"logps/rejected": -200.3507843017578,
"loss": 0.6894,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.050915975123643875,
"rewards/margins": 0.012286419048905373,
"rewards/rejected": 0.03862955421209335,
"step": 9000
},
{
"epoch": 1.58,
"learning_rate": 5.536523929471032e-08,
"logits/chosen": -2.725773334503174,
"logits/rejected": -2.7094340324401855,
"logps/chosen": -283.9950256347656,
"logps/rejected": -243.35842895507812,
"loss": 0.6876,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.06494607031345367,
"rewards/margins": 0.016711626201868057,
"rewards/rejected": 0.048234451562166214,
"step": 9010
},
{
"epoch": 1.58,
"learning_rate": 5.531486146095717e-08,
"logits/chosen": -2.817140579223633,
"logits/rejected": -2.810319423675537,
"logps/chosen": -226.22549438476562,
"logps/rejected": -191.5854949951172,
"loss": 0.6871,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.061543893069028854,
"rewards/margins": 0.025458836928009987,
"rewards/rejected": 0.03608505055308342,
"step": 9020
},
{
"epoch": 1.58,
"learning_rate": 5.526448362720403e-08,
"logits/chosen": -2.779113531112671,
"logits/rejected": -2.7687220573425293,
"logps/chosen": -229.80224609375,
"logps/rejected": -204.94235229492188,
"loss": 0.6867,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.05384296923875809,
"rewards/margins": 0.02316504344344139,
"rewards/rejected": 0.03067792020738125,
"step": 9030
},
{
"epoch": 1.58,
"learning_rate": 5.5214105793450885e-08,
"logits/chosen": -2.736494779586792,
"logits/rejected": -2.705517053604126,
"logps/chosen": -232.3329315185547,
"logps/rejected": -209.12216186523438,
"loss": 0.689,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.05568603798747063,
"rewards/margins": 0.011279943399131298,
"rewards/rejected": 0.04440609738230705,
"step": 9040
},
{
"epoch": 1.59,
"learning_rate": 5.5163727959697725e-08,
"logits/chosen": -2.800626039505005,
"logits/rejected": -2.7749905586242676,
"logps/chosen": -227.7764892578125,
"logps/rejected": -180.96810913085938,
"loss": 0.6876,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": 0.04726389795541763,
"rewards/margins": 0.020383086055517197,
"rewards/rejected": 0.02688080631196499,
"step": 9050
},
{
"epoch": 1.59,
"learning_rate": 5.511335012594458e-08,
"logits/chosen": -2.699848175048828,
"logits/rejected": -2.845942974090576,
"logps/chosen": -298.18463134765625,
"logps/rejected": -216.5264129638672,
"loss": 0.6855,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.058933716267347336,
"rewards/margins": 0.012239878997206688,
"rewards/rejected": 0.0466938316822052,
"step": 9060
},
{
"epoch": 1.59,
"learning_rate": 5.506297229219143e-08,
"logits/chosen": -2.8089985847473145,
"logits/rejected": -2.822813034057617,
"logps/chosen": -233.1894073486328,
"logps/rejected": -217.60147094726562,
"loss": 0.6879,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.05084647610783577,
"rewards/margins": 0.004182029515504837,
"rewards/rejected": 0.04666444659233093,
"step": 9070
},
{
"epoch": 1.59,
"learning_rate": 5.5012594458438286e-08,
"logits/chosen": -2.7646870613098145,
"logits/rejected": -2.7673144340515137,
"logps/chosen": -224.1854705810547,
"logps/rejected": -191.7845001220703,
"loss": 0.6873,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.0356200747191906,
"rewards/margins": 0.013415751047432423,
"rewards/rejected": 0.0222043227404356,
"step": 9080
},
{
"epoch": 1.59,
"learning_rate": 5.496221662468513e-08,
"logits/chosen": -2.754457950592041,
"logits/rejected": -2.818115472793579,
"logps/chosen": -299.34967041015625,
"logps/rejected": -258.12750244140625,
"loss": 0.6896,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.06361515820026398,
"rewards/margins": 0.019738245755434036,
"rewards/rejected": 0.04387691244482994,
"step": 9090
},
{
"epoch": 1.59,
"learning_rate": 5.491183879093199e-08,
"logits/chosen": -2.8182778358459473,
"logits/rejected": -2.8445849418640137,
"logps/chosen": -233.5463104248047,
"logps/rejected": -215.1799774169922,
"loss": 0.6886,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.043782927095890045,
"rewards/margins": 0.010205776430666447,
"rewards/rejected": 0.033577147871255875,
"step": 9100
},
{
"epoch": 1.6,
"learning_rate": 5.486146095717884e-08,
"logits/chosen": -2.8396553993225098,
"logits/rejected": -2.7761013507843018,
"logps/chosen": -244.1826934814453,
"logps/rejected": -222.1802520751953,
"loss": 0.6872,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.05905939266085625,
"rewards/margins": 0.010740868747234344,
"rewards/rejected": 0.0483185239136219,
"step": 9110
},
{
"epoch": 1.6,
"learning_rate": 5.4811083123425694e-08,
"logits/chosen": -2.8012256622314453,
"logits/rejected": -2.7701072692871094,
"logps/chosen": -203.14297485351562,
"logps/rejected": -186.69833374023438,
"loss": 0.6888,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.041209183633327484,
"rewards/margins": 0.008670704439282417,
"rewards/rejected": 0.032538481056690216,
"step": 9120
},
{
"epoch": 1.6,
"learning_rate": 5.4760705289672534e-08,
"logits/chosen": -2.8059725761413574,
"logits/rejected": -2.7879891395568848,
"logps/chosen": -237.21102905273438,
"logps/rejected": -198.75558471679688,
"loss": 0.6877,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04212053492665291,
"rewards/margins": 0.011806664988398552,
"rewards/rejected": 0.03031386435031891,
"step": 9130
},
{
"epoch": 1.6,
"learning_rate": 5.4710327455919395e-08,
"logits/chosen": -2.696505069732666,
"logits/rejected": -2.685786724090576,
"logps/chosen": -177.89352416992188,
"logps/rejected": -178.42393493652344,
"loss": 0.6902,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03737228736281395,
"rewards/margins": 0.0012526328209787607,
"rewards/rejected": 0.03611965477466583,
"step": 9140
},
{
"epoch": 1.6,
"learning_rate": 5.465994962216625e-08,
"logits/chosen": -2.761359691619873,
"logits/rejected": -2.7841641902923584,
"logps/chosen": -248.031982421875,
"logps/rejected": -212.16357421875,
"loss": 0.6866,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.05025426670908928,
"rewards/margins": 0.013314127922058105,
"rewards/rejected": 0.03694014251232147,
"step": 9150
},
{
"epoch": 1.6,
"learning_rate": 5.46095717884131e-08,
"logits/chosen": -2.7705512046813965,
"logits/rejected": -2.7175521850585938,
"logps/chosen": -218.7301483154297,
"logps/rejected": -175.79981994628906,
"loss": 0.6895,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": 0.0510282889008522,
"rewards/margins": 0.02606021985411644,
"rewards/rejected": 0.024968067184090614,
"step": 9160
},
{
"epoch": 1.61,
"learning_rate": 5.455919395465994e-08,
"logits/chosen": -2.6632533073425293,
"logits/rejected": -2.736161470413208,
"logps/chosen": -239.3765411376953,
"logps/rejected": -227.0360870361328,
"loss": 0.6887,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.03844603896141052,
"rewards/margins": 0.0018884660676121712,
"rewards/rejected": 0.036557577550411224,
"step": 9170
},
{
"epoch": 1.61,
"learning_rate": 5.4508816120906796e-08,
"logits/chosen": -2.732358455657959,
"logits/rejected": -2.7481753826141357,
"logps/chosen": -211.608154296875,
"logps/rejected": -191.95108032226562,
"loss": 0.6872,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.04012041911482811,
"rewards/margins": 0.0042021796107292175,
"rewards/rejected": 0.03591823950409889,
"step": 9180
},
{
"epoch": 1.61,
"learning_rate": 5.445843828715365e-08,
"logits/chosen": -2.7956507205963135,
"logits/rejected": -2.782504081726074,
"logps/chosen": -259.437744140625,
"logps/rejected": -203.3538055419922,
"loss": 0.6885,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.05651463195681572,
"rewards/margins": 0.015020245686173439,
"rewards/rejected": 0.04149438813328743,
"step": 9190
},
{
"epoch": 1.61,
"learning_rate": 5.44080604534005e-08,
"logits/chosen": -2.7223739624023438,
"logits/rejected": -2.7335617542266846,
"logps/chosen": -247.673828125,
"logps/rejected": -217.86328125,
"loss": 0.6876,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.05414513498544693,
"rewards/margins": 0.009823627769947052,
"rewards/rejected": 0.044321510940790176,
"step": 9200
},
{
"epoch": 1.61,
"learning_rate": 5.435768261964735e-08,
"logits/chosen": -2.748483419418335,
"logits/rejected": -2.700045108795166,
"logps/chosen": -252.93405151367188,
"logps/rejected": -234.80014038085938,
"loss": 0.6874,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.05770406126976013,
"rewards/margins": 0.012363392859697342,
"rewards/rejected": 0.04534066468477249,
"step": 9210
},
{
"epoch": 1.61,
"learning_rate": 5.4307304785894204e-08,
"logits/chosen": -2.8123254776000977,
"logits/rejected": -2.8114287853240967,
"logps/chosen": -220.3101348876953,
"logps/rejected": -190.74180603027344,
"loss": 0.6863,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.05203206464648247,
"rewards/margins": 0.0164670217782259,
"rewards/rejected": 0.03556504473090172,
"step": 9220
},
{
"epoch": 1.62,
"learning_rate": 5.425692695214106e-08,
"logits/chosen": -2.6993188858032227,
"logits/rejected": -2.698683023452759,
"logps/chosen": -224.6380157470703,
"logps/rejected": -183.78054809570312,
"loss": 0.6897,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.029758159071207047,
"rewards/margins": 0.004012234043329954,
"rewards/rejected": 0.025745924562215805,
"step": 9230
},
{
"epoch": 1.62,
"learning_rate": 5.420654911838791e-08,
"logits/chosen": -2.7783288955688477,
"logits/rejected": -2.765300750732422,
"logps/chosen": -257.1777038574219,
"logps/rejected": -236.02853393554688,
"loss": 0.6866,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.053491055965423584,
"rewards/margins": 0.011988423764705658,
"rewards/rejected": 0.041502632200717926,
"step": 9240
},
{
"epoch": 1.62,
"learning_rate": 5.415617128463476e-08,
"logits/chosen": -2.6956281661987305,
"logits/rejected": -2.711439371109009,
"logps/chosen": -221.18392944335938,
"logps/rejected": -181.74325561523438,
"loss": 0.6883,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0465092733502388,
"rewards/margins": 0.013767106458544731,
"rewards/rejected": 0.03274216502904892,
"step": 9250
},
{
"epoch": 1.62,
"learning_rate": 5.410579345088161e-08,
"logits/chosen": -2.6863269805908203,
"logits/rejected": -2.678377866744995,
"logps/chosen": -221.8884735107422,
"logps/rejected": -234.8877410888672,
"loss": 0.687,
"rewards/accuracies": 0.4000000059604645,
"rewards/chosen": 0.03930746018886566,
"rewards/margins": -0.004805571865290403,
"rewards/rejected": 0.04411303251981735,
"step": 9260
},
{
"epoch": 1.62,
"learning_rate": 5.4055415617128465e-08,
"logits/chosen": -2.704188585281372,
"logits/rejected": -2.7121920585632324,
"logps/chosen": -180.83108520507812,
"logps/rejected": -161.4171600341797,
"loss": 0.6877,
"rewards/accuracies": 0.44999998807907104,
"rewards/chosen": 0.030211174860596657,
"rewards/margins": 0.0018332020845264196,
"rewards/rejected": 0.028377970680594444,
"step": 9270
},
{
"epoch": 1.63,
"learning_rate": 5.400503778337532e-08,
"logits/chosen": -2.750490665435791,
"logits/rejected": -2.709672451019287,
"logps/chosen": -181.82015991210938,
"logps/rejected": -176.56161499023438,
"loss": 0.6884,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.0316244475543499,
"rewards/margins": 0.004817810840904713,
"rewards/rejected": 0.02680664137005806,
"step": 9280
},
{
"epoch": 1.63,
"learning_rate": 5.395465994962216e-08,
"logits/chosen": -2.706376075744629,
"logits/rejected": -2.684630870819092,
"logps/chosen": -205.58694458007812,
"logps/rejected": -169.49627685546875,
"loss": 0.6898,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03486959636211395,
"rewards/margins": 0.010895296931266785,
"rewards/rejected": 0.023974299430847168,
"step": 9290
},
{
"epoch": 1.63,
"learning_rate": 5.390428211586901e-08,
"logits/chosen": -2.7642054557800293,
"logits/rejected": -2.686594009399414,
"logps/chosen": -209.44400024414062,
"logps/rejected": -176.10757446289062,
"loss": 0.6888,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.0430467426776886,
"rewards/margins": 0.012011488899588585,
"rewards/rejected": 0.031035255640745163,
"step": 9300
},
{
"epoch": 1.63,
"learning_rate": 5.385390428211587e-08,
"logits/chosen": -2.851130962371826,
"logits/rejected": -2.8562734127044678,
"logps/chosen": -215.0302734375,
"logps/rejected": -205.55197143554688,
"loss": 0.6896,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.047839634120464325,
"rewards/margins": 0.004748721607029438,
"rewards/rejected": 0.04309091344475746,
"step": 9310
},
{
"epoch": 1.63,
"learning_rate": 5.3803526448362714e-08,
"logits/chosen": -2.815729856491089,
"logits/rejected": -2.8203251361846924,
"logps/chosen": -228.56088256835938,
"logps/rejected": -225.7352752685547,
"loss": 0.6898,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": 0.047780029475688934,
"rewards/margins": 0.0014233911642804742,
"rewards/rejected": 0.04635664075613022,
"step": 9320
},
{
"epoch": 1.63,
"learning_rate": 5.375314861460957e-08,
"logits/chosen": -2.782745838165283,
"logits/rejected": -2.772181510925293,
"logps/chosen": -271.4385070800781,
"logps/rejected": -241.4732208251953,
"loss": 0.6889,
"rewards/accuracies": 0.6499999761581421,
"rewards/chosen": 0.06021879240870476,
"rewards/margins": 0.013006770983338356,
"rewards/rejected": 0.04721202328801155,
"step": 9330
},
{
"epoch": 1.64,
"learning_rate": 5.370277078085642e-08,
"logits/chosen": -2.7766032218933105,
"logits/rejected": -2.708247661590576,
"logps/chosen": -223.17605590820312,
"logps/rejected": -180.75387573242188,
"loss": 0.688,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.04519111290574074,
"rewards/margins": 0.013616492971777916,
"rewards/rejected": 0.03157461807131767,
"step": 9340
},
{
"epoch": 1.64,
"learning_rate": 5.3652392947103275e-08,
"logits/chosen": -2.7174108028411865,
"logits/rejected": -2.7053213119506836,
"logps/chosen": -200.68690490722656,
"logps/rejected": -192.92942810058594,
"loss": 0.6858,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.03941025584936142,
"rewards/margins": 0.0023084853310137987,
"rewards/rejected": 0.03710177168250084,
"step": 9350
},
{
"epoch": 1.64,
"learning_rate": 5.360201511335012e-08,
"logits/chosen": -2.7744853496551514,
"logits/rejected": -2.7775588035583496,
"logps/chosen": -230.5467529296875,
"logps/rejected": -145.92202758789062,
"loss": 0.6877,
"rewards/accuracies": 0.824999988079071,
"rewards/chosen": 0.057361818850040436,
"rewards/margins": 0.030046069994568825,
"rewards/rejected": 0.02731575071811676,
"step": 9360
},
{
"epoch": 1.64,
"learning_rate": 5.3551637279596975e-08,
"logits/chosen": -2.803952693939209,
"logits/rejected": -2.676877975463867,
"logps/chosen": -189.181884765625,
"logps/rejected": -245.7015838623047,
"loss": 0.6888,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0401124581694603,
"rewards/margins": -0.004306624177843332,
"rewards/rejected": 0.04441908746957779,
"step": 9370
},
{
"epoch": 1.64,
"learning_rate": 5.350125944584383e-08,
"logits/chosen": -2.7858364582061768,
"logits/rejected": -2.7707884311676025,
"logps/chosen": -211.93972778320312,
"logps/rejected": -190.19741821289062,
"loss": 0.6889,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.03734724968671799,
"rewards/margins": 0.0010033950675278902,
"rewards/rejected": 0.03634385019540787,
"step": 9380
},
{
"epoch": 1.64,
"learning_rate": 5.345088161209068e-08,
"logits/chosen": -2.7639200687408447,
"logits/rejected": -2.776536703109741,
"logps/chosen": -227.98196411132812,
"logps/rejected": -218.516845703125,
"loss": 0.6885,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.045007266104221344,
"rewards/margins": 0.007175090257078409,
"rewards/rejected": 0.03783217817544937,
"step": 9390
},
{
"epoch": 1.65,
"learning_rate": 5.340050377833752e-08,
"logits/chosen": -2.728909969329834,
"logits/rejected": -2.7919864654541016,
"logps/chosen": -263.0089416503906,
"logps/rejected": -209.14541625976562,
"loss": 0.6875,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07431508600711823,
"rewards/margins": 0.02915819361805916,
"rewards/rejected": 0.045156896114349365,
"step": 9400
},
{
"epoch": 1.65,
"learning_rate": 5.3350125944584377e-08,
"logits/chosen": -2.732649564743042,
"logits/rejected": -2.6923861503601074,
"logps/chosen": -239.49832153320312,
"logps/rejected": -213.4709014892578,
"loss": 0.6869,
"rewards/accuracies": 0.675000011920929,
"rewards/chosen": 0.05820096284151077,
"rewards/margins": 0.018569031730294228,
"rewards/rejected": 0.0396319255232811,
"step": 9410
},
{
"epoch": 1.65,
"learning_rate": 5.329974811083123e-08,
"logits/chosen": -2.7434606552124023,
"logits/rejected": -2.7499537467956543,
"logps/chosen": -261.1266784667969,
"logps/rejected": -205.405029296875,
"loss": 0.6876,
"rewards/accuracies": 0.6000000238418579,
"rewards/chosen": 0.06213949993252754,
"rewards/margins": 0.024112531915307045,
"rewards/rejected": 0.03802696242928505,
"step": 9420
},
{
"epoch": 1.65,
"learning_rate": 5.324937027707809e-08,
"logits/chosen": -2.7199864387512207,
"logits/rejected": -2.798959970474243,
"logps/chosen": -249.7239990234375,
"logps/rejected": -202.08853149414062,
"loss": 0.6867,
"rewards/accuracies": 0.574999988079071,
"rewards/chosen": 0.0552804172039032,
"rewards/margins": 0.010709071531891823,
"rewards/rejected": 0.044571347534656525,
"step": 9430
},
{
"epoch": 1.65,
"learning_rate": 5.319899244332493e-08,
"logits/chosen": -2.7173819541931152,
"logits/rejected": -2.7432703971862793,
"logps/chosen": -216.4027557373047,
"logps/rejected": -190.73458862304688,
"loss": 0.691,
"rewards/accuracies": 0.42500001192092896,
"rewards/chosen": 0.04708380252122879,
"rewards/margins": -0.0027190011460334063,
"rewards/rejected": 0.049802809953689575,
"step": 9440
},
{
"epoch": 1.66,
"learning_rate": 5.3148614609571785e-08,
"logits/chosen": -2.7633492946624756,
"logits/rejected": -2.704305410385132,
"logps/chosen": -260.4012756347656,
"logps/rejected": -246.67404174804688,
"loss": 0.6874,
"rewards/accuracies": 0.4749999940395355,
"rewards/chosen": 0.05863087251782417,
"rewards/margins": 0.00220307894051075,
"rewards/rejected": 0.05642779916524887,
"step": 9450
},
{
"epoch": 1.66,
"learning_rate": 5.309823677581864e-08,
"logits/chosen": -2.7123265266418457,
"logits/rejected": -2.729973077774048,
"logps/chosen": -227.2530975341797,
"logps/rejected": -269.09375,
"loss": 0.6884,
"rewards/accuracies": 0.5249999761581421,
"rewards/chosen": 0.04649816080927849,
"rewards/margins": -0.0020359910558909178,
"rewards/rejected": 0.048534151166677475,
"step": 9460
},
{
"epoch": 1.66,
"learning_rate": 5.304785894206549e-08,
"logits/chosen": -2.8059744834899902,
"logits/rejected": -2.8446147441864014,
"logps/chosen": -240.58425903320312,
"logps/rejected": -197.65289306640625,
"loss": 0.6862,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.059047769755125046,
"rewards/margins": 0.01563527248799801,
"rewards/rejected": 0.04341249540448189,
"step": 9470
},
{
"epoch": 1.66,
"learning_rate": 5.299748110831234e-08,
"logits/chosen": -2.7589809894561768,
"logits/rejected": -2.745276927947998,
"logps/chosen": -252.64474487304688,
"logps/rejected": -227.1024169921875,
"loss": 0.6877,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.04754466563463211,
"rewards/margins": 0.012337127700448036,
"rewards/rejected": 0.035207539796829224,
"step": 9480
},
{
"epoch": 1.66,
"learning_rate": 5.294710327455919e-08,
"logits/chosen": -2.742103099822998,
"logits/rejected": -2.6979806423187256,
"logps/chosen": -221.4449462890625,
"logps/rejected": -201.50653076171875,
"loss": 0.6872,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.0446447879076004,
"rewards/margins": 0.01715948060154915,
"rewards/rejected": 0.027485307306051254,
"step": 9490
},
{
"epoch": 1.66,
"learning_rate": 5.2896725440806046e-08,
"logits/chosen": -2.774909734725952,
"logits/rejected": -2.7038991451263428,
"logps/chosen": -258.15899658203125,
"logps/rejected": -182.76722717285156,
"loss": 0.6852,
"rewards/accuracies": 0.7250000238418579,
"rewards/chosen": 0.056605808436870575,
"rewards/margins": 0.020097170025110245,
"rewards/rejected": 0.036508649587631226,
"step": 9500
}
],
"logging_steps": 10,
"max_steps": 20000,
"num_train_epochs": 4,
"save_steps": 500,
"total_flos": 0.0,
"trial_name": null,
"trial_params": null
}