diff --git "a/trainer_state.json" "b/trainer_state.json" new file mode 100644--- /dev/null +++ "b/trainer_state.json" @@ -0,0 +1,13333 @@ +{ + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.6640392362935716, + "eval_steps": 10000, + "global_step": 9500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.0, + "learning_rate": 6.666666666666666e-10, + "logits/chosen": -2.8252084255218506, + "logits/rejected": -2.962496042251587, + "logps/chosen": -145.02584838867188, + "logps/rejected": -154.2101593017578, + "loss": 0.6931, + "rewards/accuracies": 0.0, + "rewards/chosen": 0.0, + "rewards/margins": 0.0, + "rewards/rejected": 0.0, + "step": 1 + }, + { + "epoch": 0.0, + "learning_rate": 6.666666666666666e-09, + "logits/chosen": -2.758862018585205, + "logits/rejected": -2.733859062194824, + "logps/chosen": -232.04269409179688, + "logps/rejected": -191.10357666015625, + "loss": 0.693, + "rewards/accuracies": 0.4444444477558136, + "rewards/chosen": -0.0011513985227793455, + "rewards/margins": -0.001275173737667501, + "rewards/rejected": 0.00012377536040730774, + "step": 10 + }, + { + "epoch": 0.0, + "learning_rate": 1.3333333333333332e-08, + "logits/chosen": -2.7594728469848633, + "logits/rejected": -2.7667908668518066, + "logps/chosen": -246.5968780517578, + "logps/rejected": -213.8126678466797, + "loss": 0.6931, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": -0.0009503777837380767, + "rewards/margins": 0.00045707420213148, + "rewards/rejected": -0.0014074521604925394, + "step": 20 + }, + { + "epoch": 0.01, + "learning_rate": 2e-08, + "logits/chosen": -2.7216076850891113, + "logits/rejected": -2.7468366622924805, + "logps/chosen": -258.4103698730469, + "logps/rejected": -267.4147033691406, + "loss": 0.6937, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": -0.00010261923307552934, + "rewards/margins": -0.0023887469433248043, + "rewards/rejected": 0.002286128234118223, + "step": 30 + }, + { + "epoch": 0.01, + "learning_rate": 2.6666666666666664e-08, + "logits/chosen": -2.871617078781128, + "logits/rejected": -2.801084518432617, + "logps/chosen": -242.60867309570312, + "logps/rejected": -232.33499145507812, + "loss": 0.6928, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0018373109633103013, + "rewards/margins": 0.00041042696102522314, + "rewards/rejected": 0.0014268836239352822, + "step": 40 + }, + { + "epoch": 0.01, + "learning_rate": 3.333333333333333e-08, + "logits/chosen": -2.680046796798706, + "logits/rejected": -2.714757204055786, + "logps/chosen": -240.3429718017578, + "logps/rejected": -184.65933227539062, + "loss": 0.6932, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": -2.7602236514212564e-05, + "rewards/margins": 0.00031870920793153346, + "rewards/rejected": -0.0003463116008788347, + "step": 50 + }, + { + "epoch": 0.01, + "learning_rate": 4e-08, + "logits/chosen": -2.796433448791504, + "logits/rejected": -2.823643684387207, + "logps/chosen": -217.6321258544922, + "logps/rejected": -171.95498657226562, + "loss": 0.6931, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": -0.00015609370893798769, + "rewards/margins": 0.00023442933161277324, + "rewards/rejected": -0.00039052290958352387, + "step": 60 + }, + { + "epoch": 0.01, + "learning_rate": 4.666666666666667e-08, + "logits/chosen": -2.7592403888702393, + "logits/rejected": -2.7623109817504883, + "logps/chosen": -216.8944854736328, + "logps/rejected": -218.29275512695312, + "loss": 0.6928, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": -0.001479600090533495, + "rewards/margins": 0.00030887164757587016, + "rewards/rejected": -0.0017884715925902128, + "step": 70 + }, + { + "epoch": 0.01, + "learning_rate": 5.333333333333333e-08, + "logits/chosen": -2.6831583976745605, + "logits/rejected": -2.708047866821289, + "logps/chosen": -271.333984375, + "logps/rejected": -211.88742065429688, + "loss": 0.6931, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.001955702668055892, + "rewards/margins": 0.003820312675088644, + "rewards/rejected": -0.0018646096577867866, + "step": 80 + }, + { + "epoch": 0.02, + "learning_rate": 6e-08, + "logits/chosen": -2.7753825187683105, + "logits/rejected": -2.754791259765625, + "logps/chosen": -197.63711547851562, + "logps/rejected": -200.37274169921875, + "loss": 0.6933, + "rewards/accuracies": 0.32499998807907104, + "rewards/chosen": -0.001247849315404892, + "rewards/margins": -0.002036663005128503, + "rewards/rejected": 0.000788813573308289, + "step": 90 + }, + { + "epoch": 0.02, + "learning_rate": 6.666666666666665e-08, + "logits/chosen": -2.799436569213867, + "logits/rejected": -2.7348275184631348, + "logps/chosen": -273.90789794921875, + "logps/rejected": -223.2024383544922, + "loss": 0.6931, + "rewards/accuracies": 0.5, + "rewards/chosen": -0.0007920874049887061, + "rewards/margins": -1.7427420971216634e-05, + "rewards/rejected": -0.000774660031311214, + "step": 100 + }, + { + "epoch": 0.02, + "learning_rate": 7.333333333333333e-08, + "logits/chosen": -2.702688217163086, + "logits/rejected": -2.7402188777923584, + "logps/chosen": -237.420654296875, + "logps/rejected": -176.0985870361328, + "loss": 0.693, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0006930113304406404, + "rewards/margins": 0.0016551170265302062, + "rewards/rejected": -0.0009621057542972267, + "step": 110 + }, + { + "epoch": 0.02, + "learning_rate": 8e-08, + "logits/chosen": -2.7931458950042725, + "logits/rejected": -2.732015371322632, + "logps/chosen": -234.2708282470703, + "logps/rejected": -191.72213745117188, + "loss": 0.6933, + "rewards/accuracies": 0.30000001192092896, + "rewards/chosen": -0.001032972359098494, + "rewards/margins": -0.0020988043397665024, + "rewards/rejected": 0.001065832213498652, + "step": 120 + }, + { + "epoch": 0.02, + "learning_rate": 8.666666666666666e-08, + "logits/chosen": -2.7383856773376465, + "logits/rejected": -2.778128147125244, + "logps/chosen": -236.73348999023438, + "logps/rejected": -212.9311065673828, + "loss": 0.6931, + "rewards/accuracies": 0.375, + "rewards/chosen": -0.0009975699940696359, + "rewards/margins": -0.0017474631313234568, + "rewards/rejected": 0.0007498931954614818, + "step": 130 + }, + { + "epoch": 0.02, + "learning_rate": 9.333333333333334e-08, + "logits/chosen": -2.770118236541748, + "logits/rejected": -2.8189587593078613, + "logps/chosen": -242.80325317382812, + "logps/rejected": -248.46408081054688, + "loss": 0.6932, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": -0.001506878761574626, + "rewards/margins": -0.0005925501463934779, + "rewards/rejected": -0.0009143284405581653, + "step": 140 + }, + { + "epoch": 0.03, + "learning_rate": 1e-07, + "logits/chosen": -2.7896523475646973, + "logits/rejected": -2.8789305686950684, + "logps/chosen": -279.1468505859375, + "logps/rejected": -286.92449951171875, + "loss": 0.6932, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.001270245062187314, + "rewards/margins": 0.0007720521534793079, + "rewards/rejected": 0.0004981928505003452, + "step": 150 + }, + { + "epoch": 0.03, + "learning_rate": 9.994962216624685e-08, + "logits/chosen": -2.7570908069610596, + "logits/rejected": -2.7672576904296875, + "logps/chosen": -237.09164428710938, + "logps/rejected": -215.8179473876953, + "loss": 0.6935, + "rewards/accuracies": 0.375, + "rewards/chosen": -0.0016938255866989493, + "rewards/margins": -0.00298044690862298, + "rewards/rejected": 0.0012866210890933871, + "step": 160 + }, + { + "epoch": 0.03, + "learning_rate": 9.989924433249369e-08, + "logits/chosen": -2.8499808311462402, + "logits/rejected": -2.8154406547546387, + "logps/chosen": -264.3780822753906, + "logps/rejected": -214.450439453125, + "loss": 0.6932, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.001735908561386168, + "rewards/margins": 0.001296285423450172, + "rewards/rejected": 0.00043962281779386103, + "step": 170 + }, + { + "epoch": 0.03, + "learning_rate": 9.984886649874054e-08, + "logits/chosen": -2.6970016956329346, + "logits/rejected": -2.7668747901916504, + "logps/chosen": -222.513671875, + "logps/rejected": -189.9994354248047, + "loss": 0.6933, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0020346306264400482, + "rewards/margins": 0.0011342220241203904, + "rewards/rejected": 0.0009004086023196578, + "step": 180 + }, + { + "epoch": 0.03, + "learning_rate": 9.97984886649874e-08, + "logits/chosen": -2.730062484741211, + "logits/rejected": -2.8065617084503174, + "logps/chosen": -278.373046875, + "logps/rejected": -261.8786315917969, + "loss": 0.6933, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": -0.0013691270723938942, + "rewards/margins": -0.0007420595502480865, + "rewards/rejected": -0.0006270675803534687, + "step": 190 + }, + { + "epoch": 0.04, + "learning_rate": 9.974811083123425e-08, + "logits/chosen": -2.773843765258789, + "logits/rejected": -2.774496555328369, + "logps/chosen": -243.3163604736328, + "logps/rejected": -234.8438720703125, + "loss": 0.6931, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0005632409593090415, + "rewards/margins": -4.069525675731711e-05, + "rewards/rejected": 0.0006039362633600831, + "step": 200 + }, + { + "epoch": 0.04, + "learning_rate": 9.96977329974811e-08, + "logits/chosen": -2.797464370727539, + "logits/rejected": -2.779179811477661, + "logps/chosen": -213.2550506591797, + "logps/rejected": -183.4717254638672, + "loss": 0.6929, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.001099438639357686, + "rewards/margins": -0.0010665215086191893, + "rewards/rejected": 0.0021659601479768753, + "step": 210 + }, + { + "epoch": 0.04, + "learning_rate": 9.964735516372796e-08, + "logits/chosen": -2.672825336456299, + "logits/rejected": -2.753871440887451, + "logps/chosen": -187.55667114257812, + "logps/rejected": -199.6050262451172, + "loss": 0.6932, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": -0.00040147211984731257, + "rewards/margins": -0.0006626142421737313, + "rewards/rejected": 0.0002611424424685538, + "step": 220 + }, + { + "epoch": 0.04, + "learning_rate": 9.959697732997481e-08, + "logits/chosen": -2.73313570022583, + "logits/rejected": -2.7167673110961914, + "logps/chosen": -207.70272827148438, + "logps/rejected": -201.5740203857422, + "loss": 0.6933, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": -0.001323978416621685, + "rewards/margins": -0.0013272857759147882, + "rewards/rejected": 3.307475708425045e-06, + "step": 230 + }, + { + "epoch": 0.04, + "learning_rate": 9.954659949622166e-08, + "logits/chosen": -2.7659072875976562, + "logits/rejected": -2.854525566101074, + "logps/chosen": -247.24267578125, + "logps/rejected": -216.25, + "loss": 0.6931, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": -0.0007479648338630795, + "rewards/margins": 0.00017742058844305575, + "rewards/rejected": -0.0009253855096176267, + "step": 240 + }, + { + "epoch": 0.04, + "learning_rate": 9.94962216624685e-08, + "logits/chosen": -2.681570053100586, + "logits/rejected": -2.746302843093872, + "logps/chosen": -305.2917785644531, + "logps/rejected": -295.3072509765625, + "loss": 0.693, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0004612560442183167, + "rewards/margins": 0.0005774974706582725, + "rewards/rejected": -0.0001162414118880406, + "step": 250 + }, + { + "epoch": 0.05, + "learning_rate": 9.944584382871536e-08, + "logits/chosen": -2.7773802280426025, + "logits/rejected": -2.7356131076812744, + "logps/chosen": -260.58135986328125, + "logps/rejected": -247.7050323486328, + "loss": 0.6932, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0014422254171222448, + "rewards/margins": 0.0032965210266411304, + "rewards/rejected": -0.0018542958423495293, + "step": 260 + }, + { + "epoch": 0.05, + "learning_rate": 9.939546599496221e-08, + "logits/chosen": -2.6985695362091064, + "logits/rejected": -2.768378257751465, + "logps/chosen": -209.56796264648438, + "logps/rejected": -199.95033264160156, + "loss": 0.6935, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": -0.000545819231774658, + "rewards/margins": 0.0005106240278109908, + "rewards/rejected": -0.0010564432013779879, + "step": 270 + }, + { + "epoch": 0.05, + "learning_rate": 9.934508816120907e-08, + "logits/chosen": -2.7142832279205322, + "logits/rejected": -2.727756977081299, + "logps/chosen": -311.3549499511719, + "logps/rejected": -293.3232727050781, + "loss": 0.693, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.001072610029950738, + "rewards/margins": 0.0006248473073355854, + "rewards/rejected": 0.0004477625770960003, + "step": 280 + }, + { + "epoch": 0.05, + "learning_rate": 9.929471032745591e-08, + "logits/chosen": -2.6512770652770996, + "logits/rejected": -2.677826404571533, + "logps/chosen": -217.1204833984375, + "logps/rejected": -199.79481506347656, + "loss": 0.6928, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 5.9052497817901894e-05, + "rewards/margins": 0.00203351816162467, + "rewards/rejected": -0.0019744650926440954, + "step": 290 + }, + { + "epoch": 0.05, + "learning_rate": 9.924433249370276e-08, + "logits/chosen": -2.6881537437438965, + "logits/rejected": -2.7492778301239014, + "logps/chosen": -277.6586608886719, + "logps/rejected": -240.2971954345703, + "loss": 0.6931, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0018934666877612472, + "rewards/margins": 0.001739538973197341, + "rewards/rejected": 0.00015392780187539756, + "step": 300 + }, + { + "epoch": 0.05, + "learning_rate": 9.919395465994961e-08, + "logits/chosen": -2.7815330028533936, + "logits/rejected": -2.7532501220703125, + "logps/chosen": -257.75836181640625, + "logps/rejected": -200.2654571533203, + "loss": 0.6934, + "rewards/accuracies": 0.375, + "rewards/chosen": -0.0008091029012575746, + "rewards/margins": -0.001112941768951714, + "rewards/rejected": 0.00030383875127881765, + "step": 310 + }, + { + "epoch": 0.06, + "learning_rate": 9.914357682619647e-08, + "logits/chosen": -2.826770782470703, + "logits/rejected": -2.845146417617798, + "logps/chosen": -250.01553344726562, + "logps/rejected": -218.0773162841797, + "loss": 0.6933, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.00093313108664006, + "rewards/margins": 0.0006354941288009286, + "rewards/rejected": 0.00029763689963147044, + "step": 320 + }, + { + "epoch": 0.06, + "learning_rate": 9.909319899244332e-08, + "logits/chosen": -2.6958234310150146, + "logits/rejected": -2.7005648612976074, + "logps/chosen": -236.06967163085938, + "logps/rejected": -190.2051239013672, + "loss": 0.6931, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.0011252507101744413, + "rewards/margins": -0.00028516483143903315, + "rewards/rejected": 0.0014104156289249659, + "step": 330 + }, + { + "epoch": 0.06, + "learning_rate": 9.904282115869017e-08, + "logits/chosen": -2.7159180641174316, + "logits/rejected": -2.755709648132324, + "logps/chosen": -232.99978637695312, + "logps/rejected": -195.90316772460938, + "loss": 0.6931, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0008891105535440147, + "rewards/margins": 0.0006613129517063498, + "rewards/rejected": 0.00022779754363000393, + "step": 340 + }, + { + "epoch": 0.06, + "learning_rate": 9.899244332493703e-08, + "logits/chosen": -2.8205747604370117, + "logits/rejected": -2.790215253829956, + "logps/chosen": -235.89877319335938, + "logps/rejected": -194.9135284423828, + "loss": 0.6931, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": -0.0006920454325154424, + "rewards/margins": -0.0019427335355430841, + "rewards/rejected": 0.001250688568688929, + "step": 350 + }, + { + "epoch": 0.06, + "learning_rate": 9.894206549118388e-08, + "logits/chosen": -2.706644058227539, + "logits/rejected": -2.7300548553466797, + "logps/chosen": -224.51806640625, + "logps/rejected": -253.60177612304688, + "loss": 0.6932, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": -0.0006736659561283886, + "rewards/margins": -0.002054039854556322, + "rewards/rejected": 0.0013803739566355944, + "step": 360 + }, + { + "epoch": 0.06, + "learning_rate": 9.889168765743072e-08, + "logits/chosen": -2.7433345317840576, + "logits/rejected": -2.810014247894287, + "logps/chosen": -223.27615356445312, + "logps/rejected": -212.83901977539062, + "loss": 0.693, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": -0.00019951626018155366, + "rewards/margins": -0.000935495481826365, + "rewards/rejected": 0.0007359791197814047, + "step": 370 + }, + { + "epoch": 0.07, + "learning_rate": 9.884130982367758e-08, + "logits/chosen": -2.8322505950927734, + "logits/rejected": -2.8160457611083984, + "logps/chosen": -257.120361328125, + "logps/rejected": -204.89254760742188, + "loss": 0.693, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.001022899174131453, + "rewards/margins": 0.000910973350983113, + "rewards/rejected": 0.0001119256266974844, + "step": 380 + }, + { + "epoch": 0.07, + "learning_rate": 9.879093198992443e-08, + "logits/chosen": -2.675583839416504, + "logits/rejected": -2.6759538650512695, + "logps/chosen": -195.3834686279297, + "logps/rejected": -161.30630493164062, + "loss": 0.6931, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0015894779935479164, + "rewards/margins": 0.0003656911721918732, + "rewards/rejected": 0.0012237867340445518, + "step": 390 + }, + { + "epoch": 0.07, + "learning_rate": 9.874055415617128e-08, + "logits/chosen": -2.775231122970581, + "logits/rejected": -2.8162126541137695, + "logps/chosen": -293.67376708984375, + "logps/rejected": -233.018798828125, + "loss": 0.693, + "rewards/accuracies": 0.5, + "rewards/chosen": -0.0006875410908833146, + "rewards/margins": -0.0008610993390902877, + "rewards/rejected": 0.00017355827731080353, + "step": 400 + }, + { + "epoch": 0.07, + "learning_rate": 9.869017632241812e-08, + "logits/chosen": -2.7781994342803955, + "logits/rejected": -2.8431591987609863, + "logps/chosen": -244.99267578125, + "logps/rejected": -192.35743713378906, + "loss": 0.6932, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.00142839050386101, + "rewards/margins": -0.0006640168721787632, + "rewards/rejected": 0.0020924073178321123, + "step": 410 + }, + { + "epoch": 0.07, + "learning_rate": 9.863979848866498e-08, + "logits/chosen": -2.7019505500793457, + "logits/rejected": -2.7378628253936768, + "logps/chosen": -237.5064697265625, + "logps/rejected": -203.72897338867188, + "loss": 0.6937, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0007829790702089667, + "rewards/margins": -0.0010059999767690897, + "rewards/rejected": 0.0017889788141474128, + "step": 420 + }, + { + "epoch": 0.08, + "learning_rate": 9.858942065491183e-08, + "logits/chosen": -2.741657257080078, + "logits/rejected": -2.771892547607422, + "logps/chosen": -246.7175750732422, + "logps/rejected": -202.51193237304688, + "loss": 0.693, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.00037730118492618203, + "rewards/margins": 0.00044115298078395426, + "rewards/rejected": -6.385180313372985e-05, + "step": 430 + }, + { + "epoch": 0.08, + "learning_rate": 9.853904282115868e-08, + "logits/chosen": -2.741157054901123, + "logits/rejected": -2.7170910835266113, + "logps/chosen": -230.9762725830078, + "logps/rejected": -197.1507110595703, + "loss": 0.6933, + "rewards/accuracies": 0.375, + "rewards/chosen": -5.774973033112474e-05, + "rewards/margins": -0.0021546499338001013, + "rewards/rejected": 0.002096900250762701, + "step": 440 + }, + { + "epoch": 0.08, + "learning_rate": 9.848866498740554e-08, + "logits/chosen": -2.797440767288208, + "logits/rejected": -2.752779245376587, + "logps/chosen": -245.9729766845703, + "logps/rejected": -222.7683868408203, + "loss": 0.6933, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": 0.0005045041325502098, + "rewards/margins": -0.0016038778703659773, + "rewards/rejected": 0.0021083818282932043, + "step": 450 + }, + { + "epoch": 0.08, + "learning_rate": 9.843828715365239e-08, + "logits/chosen": -2.728309154510498, + "logits/rejected": -2.7414863109588623, + "logps/chosen": -225.4750518798828, + "logps/rejected": -217.5722198486328, + "loss": 0.6929, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0019893483258783817, + "rewards/margins": 0.0019943092484027147, + "rewards/rejected": -4.960992555425037e-06, + "step": 460 + }, + { + "epoch": 0.08, + "learning_rate": 9.838790931989925e-08, + "logits/chosen": -2.6399004459381104, + "logits/rejected": -2.6418204307556152, + "logps/chosen": -259.00262451171875, + "logps/rejected": -232.1974639892578, + "loss": 0.693, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": -0.00039179419400170445, + "rewards/margins": -0.001004178891889751, + "rewards/rejected": 0.0006123848725110292, + "step": 470 + }, + { + "epoch": 0.08, + "learning_rate": 9.833753148614609e-08, + "logits/chosen": -2.7012977600097656, + "logits/rejected": -2.734711170196533, + "logps/chosen": -259.11505126953125, + "logps/rejected": -212.99191284179688, + "loss": 0.693, + "rewards/accuracies": 0.5, + "rewards/chosen": 3.07522714138031e-05, + "rewards/margins": -0.0009926442289724946, + "rewards/rejected": 0.0010233965003862977, + "step": 480 + }, + { + "epoch": 0.09, + "learning_rate": 9.828715365239294e-08, + "logits/chosen": -2.779294967651367, + "logits/rejected": -2.742389678955078, + "logps/chosen": -219.0150909423828, + "logps/rejected": -213.0858612060547, + "loss": 0.6936, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0007726555922999978, + "rewards/margins": -0.0002816848282236606, + "rewards/rejected": 0.0010543405078351498, + "step": 490 + }, + { + "epoch": 0.09, + "learning_rate": 9.823677581863979e-08, + "logits/chosen": -2.7667160034179688, + "logits/rejected": -2.746671199798584, + "logps/chosen": -241.52261352539062, + "logps/rejected": -244.81637573242188, + "loss": 0.6932, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0008761234348639846, + "rewards/margins": 0.000312745978590101, + "rewards/rejected": 0.0005633773980662227, + "step": 500 + }, + { + "epoch": 0.09, + "learning_rate": 9.818639798488665e-08, + "logits/chosen": -2.773653507232666, + "logits/rejected": -2.7031195163726807, + "logps/chosen": -188.9192352294922, + "logps/rejected": -198.82492065429688, + "loss": 0.6927, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0020457953214645386, + "rewards/margins": 0.0025221453979611397, + "rewards/rejected": -0.0004763497563544661, + "step": 510 + }, + { + "epoch": 0.09, + "learning_rate": 9.813602015113349e-08, + "logits/chosen": -2.767975330352783, + "logits/rejected": -2.745241641998291, + "logps/chosen": -255.3336639404297, + "logps/rejected": -210.2073516845703, + "loss": 0.6932, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0016272428911179304, + "rewards/margins": -3.840450517600402e-05, + "rewards/rejected": 0.0016656474908813834, + "step": 520 + }, + { + "epoch": 0.09, + "learning_rate": 9.808564231738034e-08, + "logits/chosen": -2.701375961303711, + "logits/rejected": -2.740355968475342, + "logps/chosen": -194.14346313476562, + "logps/rejected": -195.3939971923828, + "loss": 0.6931, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.001990049611777067, + "rewards/margins": -0.0021429904736578465, + "rewards/rejected": 0.004133040551096201, + "step": 530 + }, + { + "epoch": 0.09, + "learning_rate": 9.80352644836272e-08, + "logits/chosen": -2.7491579055786133, + "logits/rejected": -2.8547916412353516, + "logps/chosen": -257.10809326171875, + "logps/rejected": -218.61026000976562, + "loss": 0.6932, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0014056519139558077, + "rewards/margins": -7.3385540417802986e-06, + "rewards/rejected": 0.001412990503013134, + "step": 540 + }, + { + "epoch": 0.1, + "learning_rate": 9.798488664987405e-08, + "logits/chosen": -2.762587308883667, + "logits/rejected": -2.7138381004333496, + "logps/chosen": -250.11111450195312, + "logps/rejected": -210.0104217529297, + "loss": 0.6931, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0026454334147274494, + "rewards/margins": 0.0003759107203222811, + "rewards/rejected": 0.0022695225197821856, + "step": 550 + }, + { + "epoch": 0.1, + "learning_rate": 9.79345088161209e-08, + "logits/chosen": -2.7964959144592285, + "logits/rejected": -2.812797784805298, + "logps/chosen": -262.03253173828125, + "logps/rejected": -205.50057983398438, + "loss": 0.6931, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0009436160326004028, + "rewards/margins": 0.0005760550848208368, + "rewards/rejected": 0.00036756088957190514, + "step": 560 + }, + { + "epoch": 0.1, + "learning_rate": 9.788413098236776e-08, + "logits/chosen": -2.8215677738189697, + "logits/rejected": -2.803280830383301, + "logps/chosen": -243.072998046875, + "logps/rejected": -198.3536376953125, + "loss": 0.6928, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0028980812057852745, + "rewards/margins": 0.002744231838732958, + "rewards/rejected": 0.00015384898870252073, + "step": 570 + }, + { + "epoch": 0.1, + "learning_rate": 9.783375314861461e-08, + "logits/chosen": -2.8663644790649414, + "logits/rejected": -2.8302829265594482, + "logps/chosen": -231.59359741210938, + "logps/rejected": -258.3666076660156, + "loss": 0.6932, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.0001844273356255144, + "rewards/margins": -0.002044522203505039, + "rewards/rejected": 0.0022289494518190622, + "step": 580 + }, + { + "epoch": 0.1, + "learning_rate": 9.778337531486146e-08, + "logits/chosen": -2.7864925861358643, + "logits/rejected": -2.7147817611694336, + "logps/chosen": -229.01431274414062, + "logps/rejected": -186.32522583007812, + "loss": 0.6928, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 2.3794593744241865e-06, + "rewards/margins": 0.0006320485845208168, + "rewards/rejected": -0.000629669229965657, + "step": 590 + }, + { + "epoch": 0.11, + "learning_rate": 9.77329974811083e-08, + "logits/chosen": -2.754164218902588, + "logits/rejected": -2.7349648475646973, + "logps/chosen": -216.50918579101562, + "logps/rejected": -186.99282836914062, + "loss": 0.6928, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0005909929750487208, + "rewards/margins": 5.385982876759954e-05, + "rewards/rejected": 0.0005371329025365412, + "step": 600 + }, + { + "epoch": 0.11, + "learning_rate": 9.768261964735516e-08, + "logits/chosen": -2.754659652709961, + "logits/rejected": -2.727217197418213, + "logps/chosen": -236.4612274169922, + "logps/rejected": -213.8798828125, + "loss": 0.693, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0012212401488795877, + "rewards/margins": 0.00041647389298304915, + "rewards/rejected": 0.0008047660812735558, + "step": 610 + }, + { + "epoch": 0.11, + "learning_rate": 9.763224181360201e-08, + "logits/chosen": -2.767381191253662, + "logits/rejected": -2.773684501647949, + "logps/chosen": -276.1978759765625, + "logps/rejected": -241.90969848632812, + "loss": 0.6926, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.0022741584107279778, + "rewards/margins": 0.0036654185969382524, + "rewards/rejected": -0.0013912600697949529, + "step": 620 + }, + { + "epoch": 0.11, + "learning_rate": 9.758186397984886e-08, + "logits/chosen": -2.7231290340423584, + "logits/rejected": -2.799967050552368, + "logps/chosen": -288.275634765625, + "logps/rejected": -215.36392211914062, + "loss": 0.6932, + "rewards/accuracies": 0.3499999940395355, + "rewards/chosen": -8.152765076374635e-05, + "rewards/margins": -0.003193531883880496, + "rewards/rejected": 0.0031120043713599443, + "step": 630 + }, + { + "epoch": 0.11, + "learning_rate": 9.75314861460957e-08, + "logits/chosen": -2.8058621883392334, + "logits/rejected": -2.811411142349243, + "logps/chosen": -263.43182373046875, + "logps/rejected": -255.8742218017578, + "loss": 0.6928, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.0022689211182296276, + "rewards/margins": 0.0014448559377342463, + "rewards/rejected": 0.0008240645984187722, + "step": 640 + }, + { + "epoch": 0.11, + "learning_rate": 9.748110831234256e-08, + "logits/chosen": -2.8055179119110107, + "logits/rejected": -2.751683235168457, + "logps/chosen": -190.2101287841797, + "logps/rejected": -180.5990447998047, + "loss": 0.6926, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.00034066467196680605, + "rewards/margins": 0.001460460713133216, + "rewards/rejected": -0.0011197957210242748, + "step": 650 + }, + { + "epoch": 0.12, + "learning_rate": 9.743073047858941e-08, + "logits/chosen": -2.6653835773468018, + "logits/rejected": -2.6121246814727783, + "logps/chosen": -209.80648803710938, + "logps/rejected": -229.5626983642578, + "loss": 0.6933, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.0011562244035303593, + "rewards/margins": 0.00043965905206277966, + "rewards/rejected": 0.000716565118636936, + "step": 660 + }, + { + "epoch": 0.12, + "learning_rate": 9.738035264483628e-08, + "logits/chosen": -2.756425380706787, + "logits/rejected": -2.6906371116638184, + "logps/chosen": -208.0061798095703, + "logps/rejected": -227.17526245117188, + "loss": 0.6929, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.003370731370523572, + "rewards/margins": 0.0021752621978521347, + "rewards/rejected": 0.0011954689398407936, + "step": 670 + }, + { + "epoch": 0.12, + "learning_rate": 9.732997481108312e-08, + "logits/chosen": -2.748220920562744, + "logits/rejected": -2.739067554473877, + "logps/chosen": -204.1517791748047, + "logps/rejected": -174.79559326171875, + "loss": 0.6928, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0015211543068289757, + "rewards/margins": 0.001060990383848548, + "rewards/rejected": 0.0004601640102919191, + "step": 680 + }, + { + "epoch": 0.12, + "learning_rate": 9.727959697732997e-08, + "logits/chosen": -2.7568039894104004, + "logits/rejected": -2.7389419078826904, + "logps/chosen": -223.5104522705078, + "logps/rejected": -172.09033203125, + "loss": 0.6937, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": -4.150771928834729e-05, + "rewards/margins": -0.0012603879440575838, + "rewards/rejected": 0.001218880177475512, + "step": 690 + }, + { + "epoch": 0.12, + "learning_rate": 9.722921914357683e-08, + "logits/chosen": -2.762721300125122, + "logits/rejected": -2.750661611557007, + "logps/chosen": -230.8249969482422, + "logps/rejected": -231.24960327148438, + "loss": 0.6929, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0016020803013816476, + "rewards/margins": 0.0007085275137796998, + "rewards/rejected": 0.0008935527876019478, + "step": 700 + }, + { + "epoch": 0.12, + "learning_rate": 9.717884130982368e-08, + "logits/chosen": -2.6903281211853027, + "logits/rejected": -2.668412685394287, + "logps/chosen": -173.5829315185547, + "logps/rejected": -174.61099243164062, + "loss": 0.6931, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": -0.0005260295001789927, + "rewards/margins": -0.0008247641962952912, + "rewards/rejected": 0.00029873469611629844, + "step": 710 + }, + { + "epoch": 0.13, + "learning_rate": 9.712846347607052e-08, + "logits/chosen": -2.7260491847991943, + "logits/rejected": -2.723248243331909, + "logps/chosen": -228.8632049560547, + "logps/rejected": -191.02725219726562, + "loss": 0.6935, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.002371068811044097, + "rewards/margins": -0.0012089888332411647, + "rewards/rejected": 0.00358005752786994, + "step": 720 + }, + { + "epoch": 0.13, + "learning_rate": 9.707808564231737e-08, + "logits/chosen": -2.7456154823303223, + "logits/rejected": -2.681551456451416, + "logps/chosen": -257.8016052246094, + "logps/rejected": -246.4755096435547, + "loss": 0.6933, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.000685253064148128, + "rewards/margins": -0.0014969928888604045, + "rewards/rejected": 0.002182246185839176, + "step": 730 + }, + { + "epoch": 0.13, + "learning_rate": 9.702770780856423e-08, + "logits/chosen": -2.7827036380767822, + "logits/rejected": -2.7841458320617676, + "logps/chosen": -221.7444610595703, + "logps/rejected": -198.41885375976562, + "loss": 0.6932, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.0009337845258414745, + "rewards/margins": 8.86632114998065e-05, + "rewards/rejected": 0.0008451213943772018, + "step": 740 + }, + { + "epoch": 0.13, + "learning_rate": 9.697732997481108e-08, + "logits/chosen": -2.763047456741333, + "logits/rejected": -2.8110077381134033, + "logps/chosen": -236.8753204345703, + "logps/rejected": -191.76792907714844, + "loss": 0.6931, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.003436017083004117, + "rewards/margins": 0.000934536918066442, + "rewards/rejected": 0.0025014798156917095, + "step": 750 + }, + { + "epoch": 0.13, + "learning_rate": 9.692695214105792e-08, + "logits/chosen": -2.726303815841675, + "logits/rejected": -2.7912750244140625, + "logps/chosen": -315.33441162109375, + "logps/rejected": -216.3941650390625, + "loss": 0.6924, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0015838576946407557, + "rewards/margins": 0.0014837884809821844, + "rewards/rejected": 0.0001000691408989951, + "step": 760 + }, + { + "epoch": 0.13, + "learning_rate": 9.687657430730478e-08, + "logits/chosen": -2.702937602996826, + "logits/rejected": -2.7665514945983887, + "logps/chosen": -221.53292846679688, + "logps/rejected": -171.7909393310547, + "loss": 0.6927, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.0022713050711899996, + "rewards/margins": -0.00044591521145775914, + "rewards/rejected": 0.0027172204572707415, + "step": 770 + }, + { + "epoch": 0.14, + "learning_rate": 9.682619647355164e-08, + "logits/chosen": -2.83231520652771, + "logits/rejected": -2.841844081878662, + "logps/chosen": -228.69546508789062, + "logps/rejected": -169.39346313476562, + "loss": 0.6928, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.001805447624064982, + "rewards/margins": -0.0005494118086062372, + "rewards/rejected": 0.002354859607294202, + "step": 780 + }, + { + "epoch": 0.14, + "learning_rate": 9.677581863979848e-08, + "logits/chosen": -2.7778494358062744, + "logits/rejected": -2.7811062335968018, + "logps/chosen": -215.41586303710938, + "logps/rejected": -208.3562469482422, + "loss": 0.6927, + "rewards/accuracies": 0.3499999940395355, + "rewards/chosen": 0.00014900062524247915, + "rewards/margins": -0.002759304828941822, + "rewards/rejected": 0.0029083057306706905, + "step": 790 + }, + { + "epoch": 0.14, + "learning_rate": 9.672544080604534e-08, + "logits/chosen": -2.706941604614258, + "logits/rejected": -2.7043490409851074, + "logps/chosen": -252.07980346679688, + "logps/rejected": -224.51388549804688, + "loss": 0.693, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.0011368256527930498, + "rewards/margins": 0.001408792450092733, + "rewards/rejected": -0.0002719667972996831, + "step": 800 + }, + { + "epoch": 0.14, + "learning_rate": 9.667506297229219e-08, + "logits/chosen": -2.7257018089294434, + "logits/rejected": -2.688807725906372, + "logps/chosen": -230.65444946289062, + "logps/rejected": -203.5872802734375, + "loss": 0.6928, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0041201431304216385, + "rewards/margins": 0.0013161466922610998, + "rewards/rejected": 0.0028039959724992514, + "step": 810 + }, + { + "epoch": 0.14, + "learning_rate": 9.662468513853904e-08, + "logits/chosen": -2.7131431102752686, + "logits/rejected": -2.7395095825195312, + "logps/chosen": -246.7789764404297, + "logps/rejected": -224.97299194335938, + "loss": 0.6929, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0022838334552943707, + "rewards/margins": 0.0005551796639338136, + "rewards/rejected": 0.0017286535585299134, + "step": 820 + }, + { + "epoch": 0.15, + "learning_rate": 9.657430730478588e-08, + "logits/chosen": -2.801877498626709, + "logits/rejected": -2.7862987518310547, + "logps/chosen": -242.6244659423828, + "logps/rejected": -223.6712646484375, + "loss": 0.693, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0037963681388646364, + "rewards/margins": 0.0008951274794526398, + "rewards/rejected": 0.0029012407176196575, + "step": 830 + }, + { + "epoch": 0.15, + "learning_rate": 9.652392947103274e-08, + "logits/chosen": -2.763369560241699, + "logits/rejected": -2.7350258827209473, + "logps/chosen": -231.41952514648438, + "logps/rejected": -207.5250244140625, + "loss": 0.6931, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0018902644515037537, + "rewards/margins": 0.000653119117487222, + "rewards/rejected": 0.0012371453922241926, + "step": 840 + }, + { + "epoch": 0.15, + "learning_rate": 9.647355163727959e-08, + "logits/chosen": -2.709563732147217, + "logits/rejected": -2.7220940589904785, + "logps/chosen": -229.4707489013672, + "logps/rejected": -200.20779418945312, + "loss": 0.6927, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0027879923582077026, + "rewards/margins": 0.0006196832982823253, + "rewards/rejected": 0.002168309409171343, + "step": 850 + }, + { + "epoch": 0.15, + "learning_rate": 9.642317380352644e-08, + "logits/chosen": -2.7222867012023926, + "logits/rejected": -2.686190128326416, + "logps/chosen": -250.36752319335938, + "logps/rejected": -195.4890899658203, + "loss": 0.6932, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0026868334971368313, + "rewards/margins": -0.00014689173258375376, + "rewards/rejected": 0.0028337249532341957, + "step": 860 + }, + { + "epoch": 0.15, + "learning_rate": 9.637279596977329e-08, + "logits/chosen": -2.6420130729675293, + "logits/rejected": -2.7638611793518066, + "logps/chosen": -272.90576171875, + "logps/rejected": -225.89804077148438, + "loss": 0.6931, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.003827697830274701, + "rewards/margins": 0.001123771769925952, + "rewards/rejected": 0.002703926060348749, + "step": 870 + }, + { + "epoch": 0.15, + "learning_rate": 9.632241813602014e-08, + "logits/chosen": -2.804816722869873, + "logits/rejected": -2.793016195297241, + "logps/chosen": -236.7283477783203, + "logps/rejected": -191.2239990234375, + "loss": 0.693, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0009727630531415343, + "rewards/margins": -0.0009720485541038215, + "rewards/rejected": 0.0019448116654530168, + "step": 880 + }, + { + "epoch": 0.16, + "learning_rate": 9.6272040302267e-08, + "logits/chosen": -2.7938032150268555, + "logits/rejected": -2.7507739067077637, + "logps/chosen": -206.41567993164062, + "logps/rejected": -178.12667846679688, + "loss": 0.693, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.0008494978537783027, + "rewards/margins": -0.0007513789460062981, + "rewards/rejected": 0.0016008767997846007, + "step": 890 + }, + { + "epoch": 0.16, + "learning_rate": 9.622166246851386e-08, + "logits/chosen": -2.7419960498809814, + "logits/rejected": -2.8216521739959717, + "logps/chosen": -292.3438720703125, + "logps/rejected": -209.7271270751953, + "loss": 0.6927, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.00268277944996953, + "rewards/margins": -0.00072367989923805, + "rewards/rejected": 0.0034064589999616146, + "step": 900 + }, + { + "epoch": 0.16, + "learning_rate": 9.61712846347607e-08, + "logits/chosen": -2.716244697570801, + "logits/rejected": -2.7290053367614746, + "logps/chosen": -218.2609100341797, + "logps/rejected": -196.04891967773438, + "loss": 0.6932, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.0014504556311294436, + "rewards/margins": -0.0006075268611311913, + "rewards/rejected": 0.0020579826086759567, + "step": 910 + }, + { + "epoch": 0.16, + "learning_rate": 9.612090680100755e-08, + "logits/chosen": -2.7427549362182617, + "logits/rejected": -2.7771146297454834, + "logps/chosen": -205.1763916015625, + "logps/rejected": -197.89157104492188, + "loss": 0.6931, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.001757201156578958, + "rewards/margins": 0.0007729234057478607, + "rewards/rejected": 0.0009842776926234365, + "step": 920 + }, + { + "epoch": 0.16, + "learning_rate": 9.607052896725441e-08, + "logits/chosen": -2.810089349746704, + "logits/rejected": -2.7477164268493652, + "logps/chosen": -234.19094848632812, + "logps/rejected": -238.1735076904297, + "loss": 0.6928, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.0020914555061608553, + "rewards/margins": -0.0015822440618649125, + "rewards/rejected": 0.003673699451610446, + "step": 930 + }, + { + "epoch": 0.16, + "learning_rate": 9.602015113350126e-08, + "logits/chosen": -2.7463126182556152, + "logits/rejected": -2.7717044353485107, + "logps/chosen": -318.3886413574219, + "logps/rejected": -217.30325317382812, + "loss": 0.6932, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.0019021205371245742, + "rewards/margins": -0.0013187190052121878, + "rewards/rejected": 0.003220838960260153, + "step": 940 + }, + { + "epoch": 0.17, + "learning_rate": 9.59697732997481e-08, + "logits/chosen": -2.7562918663024902, + "logits/rejected": -2.737678050994873, + "logps/chosen": -212.1610870361328, + "logps/rejected": -169.73379516601562, + "loss": 0.6928, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.003521175589412451, + "rewards/margins": 0.00361448572948575, + "rewards/rejected": -9.331032924819738e-05, + "step": 950 + }, + { + "epoch": 0.17, + "learning_rate": 9.591939546599495e-08, + "logits/chosen": -2.785679340362549, + "logits/rejected": -2.775289535522461, + "logps/chosen": -266.58660888671875, + "logps/rejected": -248.35580444335938, + "loss": 0.6934, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.002367380540817976, + "rewards/margins": -0.001244062907062471, + "rewards/rejected": 0.0036114430986344814, + "step": 960 + }, + { + "epoch": 0.17, + "learning_rate": 9.586901763224181e-08, + "logits/chosen": -2.775019645690918, + "logits/rejected": -2.751147747039795, + "logps/chosen": -272.42840576171875, + "logps/rejected": -262.1443176269531, + "loss": 0.6928, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0036885985173285007, + "rewards/margins": 0.002885077614337206, + "rewards/rejected": 0.0008035210776142776, + "step": 970 + }, + { + "epoch": 0.17, + "learning_rate": 9.581863979848866e-08, + "logits/chosen": -2.726874351501465, + "logits/rejected": -2.768751621246338, + "logps/chosen": -236.5287322998047, + "logps/rejected": -211.50131225585938, + "loss": 0.6928, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.0035156819503754377, + "rewards/margins": -0.0017192515078932047, + "rewards/rejected": 0.005234933458268642, + "step": 980 + }, + { + "epoch": 0.17, + "learning_rate": 9.57682619647355e-08, + "logits/chosen": -2.7328333854675293, + "logits/rejected": -2.7810556888580322, + "logps/chosen": -253.5846405029297, + "logps/rejected": -208.56729125976562, + "loss": 0.693, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.004323097877204418, + "rewards/margins": 0.001049490412697196, + "rewards/rejected": 0.003273607464507222, + "step": 990 + }, + { + "epoch": 0.18, + "learning_rate": 9.571788413098237e-08, + "logits/chosen": -2.775546073913574, + "logits/rejected": -2.7548234462738037, + "logps/chosen": -274.9341735839844, + "logps/rejected": -214.09378051757812, + "loss": 0.693, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.004553532227873802, + "rewards/margins": 0.0013717750553041697, + "rewards/rejected": 0.003181757405400276, + "step": 1000 + }, + { + "epoch": 0.18, + "learning_rate": 9.566750629722922e-08, + "logits/chosen": -2.7104849815368652, + "logits/rejected": -2.698439121246338, + "logps/chosen": -255.5958251953125, + "logps/rejected": -174.08676147460938, + "loss": 0.6928, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.003329707309603691, + "rewards/margins": 0.0009661338990554214, + "rewards/rejected": 0.002363573294132948, + "step": 1010 + }, + { + "epoch": 0.18, + "learning_rate": 9.561712846347608e-08, + "logits/chosen": -2.667184591293335, + "logits/rejected": -2.633574962615967, + "logps/chosen": -197.6795196533203, + "logps/rejected": -169.07440185546875, + "loss": 0.6929, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.000696418690495193, + "rewards/margins": 0.0006790427723899484, + "rewards/rejected": 1.7376034520566463e-05, + "step": 1020 + }, + { + "epoch": 0.18, + "learning_rate": 9.556675062972292e-08, + "logits/chosen": -2.7279274463653564, + "logits/rejected": -2.725475311279297, + "logps/chosen": -224.8273468017578, + "logps/rejected": -199.46923828125, + "loss": 0.693, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0031109179835766554, + "rewards/margins": -3.088197991019115e-05, + "rewards/rejected": 0.0031417999416589737, + "step": 1030 + }, + { + "epoch": 0.18, + "learning_rate": 9.551637279596977e-08, + "logits/chosen": -2.7452080249786377, + "logits/rejected": -2.748317003250122, + "logps/chosen": -251.00180053710938, + "logps/rejected": -221.8520050048828, + "loss": 0.6929, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.002598334103822708, + "rewards/margins": -0.00022798255668021739, + "rewards/rejected": 0.002826316747814417, + "step": 1040 + }, + { + "epoch": 0.18, + "learning_rate": 9.546599496221662e-08, + "logits/chosen": -2.7736282348632812, + "logits/rejected": -2.7318246364593506, + "logps/chosen": -261.21356201171875, + "logps/rejected": -215.4080352783203, + "loss": 0.6927, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0046277581714093685, + "rewards/margins": 0.0004109583387617022, + "rewards/rejected": 0.004216799978166819, + "step": 1050 + }, + { + "epoch": 0.19, + "learning_rate": 9.541561712846348e-08, + "logits/chosen": -2.831284999847412, + "logits/rejected": -2.7485132217407227, + "logps/chosen": -263.9079284667969, + "logps/rejected": -222.78909301757812, + "loss": 0.6932, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.004149717278778553, + "rewards/margins": -0.0001199671532958746, + "rewards/rejected": 0.004269684199243784, + "step": 1060 + }, + { + "epoch": 0.19, + "learning_rate": 9.536523929471032e-08, + "logits/chosen": -2.7859325408935547, + "logits/rejected": -2.7743453979492188, + "logps/chosen": -205.18862915039062, + "logps/rejected": -163.95297241210938, + "loss": 0.6926, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.001009289757348597, + "rewards/margins": -0.0014739797916263342, + "rewards/rejected": 0.002483269665390253, + "step": 1070 + }, + { + "epoch": 0.19, + "learning_rate": 9.531486146095717e-08, + "logits/chosen": -2.7141454219818115, + "logits/rejected": -2.742264747619629, + "logps/chosen": -212.10800170898438, + "logps/rejected": -211.097900390625, + "loss": 0.6927, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.002731418702751398, + "rewards/margins": -0.0012434081872925162, + "rewards/rejected": 0.003974826540797949, + "step": 1080 + }, + { + "epoch": 0.19, + "learning_rate": 9.526448362720403e-08, + "logits/chosen": -2.646359920501709, + "logits/rejected": -2.671069622039795, + "logps/chosen": -197.65640258789062, + "logps/rejected": -180.06640625, + "loss": 0.6929, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.0025646693538874388, + "rewards/margins": 0.0011420946102589369, + "rewards/rejected": 0.0014225749764591455, + "step": 1090 + }, + { + "epoch": 0.19, + "learning_rate": 9.521410579345087e-08, + "logits/chosen": -2.7953693866729736, + "logits/rejected": -2.7932047843933105, + "logps/chosen": -197.06411743164062, + "logps/rejected": -199.5815887451172, + "loss": 0.6929, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.004566690884530544, + "rewards/margins": 4.555946361506358e-05, + "rewards/rejected": 0.00452113151550293, + "step": 1100 + }, + { + "epoch": 0.19, + "learning_rate": 9.516372795969773e-08, + "logits/chosen": -2.75532865524292, + "logits/rejected": -2.768794536590576, + "logps/chosen": -247.06533813476562, + "logps/rejected": -203.4183807373047, + "loss": 0.6934, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.0037621301598846912, + "rewards/margins": -0.00023272607359103858, + "rewards/rejected": 0.003994855564087629, + "step": 1110 + }, + { + "epoch": 0.2, + "learning_rate": 9.511335012594459e-08, + "logits/chosen": -2.7900328636169434, + "logits/rejected": -2.747842311859131, + "logps/chosen": -233.60934448242188, + "logps/rejected": -209.6956329345703, + "loss": 0.6927, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.002573530189692974, + "rewards/margins": -0.0018167212838307023, + "rewards/rejected": 0.004390250891447067, + "step": 1120 + }, + { + "epoch": 0.2, + "learning_rate": 9.506297229219144e-08, + "logits/chosen": -2.8266825675964355, + "logits/rejected": -2.7168092727661133, + "logps/chosen": -266.6517028808594, + "logps/rejected": -240.08877563476562, + "loss": 0.6932, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.005716273095458746, + "rewards/margins": 0.0027064047753810883, + "rewards/rejected": 0.003009868785738945, + "step": 1130 + }, + { + "epoch": 0.2, + "learning_rate": 9.501259445843828e-08, + "logits/chosen": -2.7689754962921143, + "logits/rejected": -2.7763471603393555, + "logps/chosen": -289.73931884765625, + "logps/rejected": -222.8748016357422, + "loss": 0.693, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.0030738338828086853, + "rewards/margins": -0.001451755058951676, + "rewards/rejected": 0.004525588359683752, + "step": 1140 + }, + { + "epoch": 0.2, + "learning_rate": 9.496221662468513e-08, + "logits/chosen": -2.768038272857666, + "logits/rejected": -2.754030704498291, + "logps/chosen": -234.2838592529297, + "logps/rejected": -202.77279663085938, + "loss": 0.6925, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.004740605130791664, + "rewards/margins": 0.0016939297784119844, + "rewards/rejected": 0.0030466755852103233, + "step": 1150 + }, + { + "epoch": 0.2, + "learning_rate": 9.491183879093199e-08, + "logits/chosen": -2.8069653511047363, + "logits/rejected": -2.7526118755340576, + "logps/chosen": -209.11172485351562, + "logps/rejected": -200.98428344726562, + "loss": 0.6925, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.005559694021940231, + "rewards/margins": 0.002170537132769823, + "rewards/rejected": 0.0033891566563397646, + "step": 1160 + }, + { + "epoch": 0.2, + "learning_rate": 9.486146095717884e-08, + "logits/chosen": -2.7833895683288574, + "logits/rejected": -2.755847930908203, + "logps/chosen": -228.0541229248047, + "logps/rejected": -222.4268035888672, + "loss": 0.6926, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.00539207411929965, + "rewards/margins": 0.0042550102807581425, + "rewards/rejected": 0.001137065002694726, + "step": 1170 + }, + { + "epoch": 0.21, + "learning_rate": 9.481108312342568e-08, + "logits/chosen": -2.8028454780578613, + "logits/rejected": -2.798689365386963, + "logps/chosen": -251.14501953125, + "logps/rejected": -244.967041015625, + "loss": 0.6929, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.0028695925138890743, + "rewards/margins": 0.0012147616362199187, + "rewards/rejected": 0.0016548307612538338, + "step": 1180 + }, + { + "epoch": 0.21, + "learning_rate": 9.476070528967254e-08, + "logits/chosen": -2.7660348415374756, + "logits/rejected": -2.8378560543060303, + "logps/chosen": -250.03372192382812, + "logps/rejected": -201.1326446533203, + "loss": 0.6933, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.005208217538893223, + "rewards/margins": 0.0004181812109891325, + "rewards/rejected": 0.004790036473423243, + "step": 1190 + }, + { + "epoch": 0.21, + "learning_rate": 9.471032745591939e-08, + "logits/chosen": -2.738584280014038, + "logits/rejected": -2.799468517303467, + "logps/chosen": -294.7505187988281, + "logps/rejected": -218.1544647216797, + "loss": 0.6929, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.002887497888877988, + "rewards/margins": 0.0018897324334830046, + "rewards/rejected": 0.000997765688225627, + "step": 1200 + }, + { + "epoch": 0.21, + "learning_rate": 9.465994962216624e-08, + "logits/chosen": -2.744781970977783, + "logits/rejected": -2.764321804046631, + "logps/chosen": -203.63406372070312, + "logps/rejected": -165.10145568847656, + "loss": 0.6934, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0023968457244336605, + "rewards/margins": 0.00017872030730359256, + "rewards/rejected": 0.002218125155195594, + "step": 1210 + }, + { + "epoch": 0.21, + "learning_rate": 9.460957178841308e-08, + "logits/chosen": -2.7360353469848633, + "logits/rejected": -2.746555805206299, + "logps/chosen": -211.74185180664062, + "logps/rejected": -180.95497131347656, + "loss": 0.6921, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.004236987791955471, + "rewards/margins": 0.0014550769701600075, + "rewards/rejected": 0.002781911287456751, + "step": 1220 + }, + { + "epoch": 0.22, + "learning_rate": 9.455919395465995e-08, + "logits/chosen": -2.7374870777130127, + "logits/rejected": -2.7698867321014404, + "logps/chosen": -215.5163116455078, + "logps/rejected": -210.37368774414062, + "loss": 0.693, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.004980830010026693, + "rewards/margins": 0.0006271142628975213, + "rewards/rejected": 0.004353716038167477, + "step": 1230 + }, + { + "epoch": 0.22, + "learning_rate": 9.45088161209068e-08, + "logits/chosen": -2.807363271713257, + "logits/rejected": -2.7921762466430664, + "logps/chosen": -199.8319091796875, + "logps/rejected": -177.23934936523438, + "loss": 0.6926, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.004381081089377403, + "rewards/margins": 0.0005592384259216487, + "rewards/rejected": 0.00382184237241745, + "step": 1240 + }, + { + "epoch": 0.22, + "learning_rate": 9.445843828715366e-08, + "logits/chosen": -2.8015992641448975, + "logits/rejected": -2.7855136394500732, + "logps/chosen": -253.15487670898438, + "logps/rejected": -222.3345947265625, + "loss": 0.6928, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.004838630557060242, + "rewards/margins": -9.69449756667018e-05, + "rewards/rejected": 0.004935575183480978, + "step": 1250 + }, + { + "epoch": 0.22, + "learning_rate": 9.44080604534005e-08, + "logits/chosen": -2.6941018104553223, + "logits/rejected": -2.6818172931671143, + "logps/chosen": -231.94412231445312, + "logps/rejected": -228.63485717773438, + "loss": 0.6922, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.00432557100430131, + "rewards/margins": -0.0011508779134601355, + "rewards/rejected": 0.005476449616253376, + "step": 1260 + }, + { + "epoch": 0.22, + "learning_rate": 9.435768261964735e-08, + "logits/chosen": -2.788661479949951, + "logits/rejected": -2.713569402694702, + "logps/chosen": -228.61123657226562, + "logps/rejected": -230.6959686279297, + "loss": 0.6933, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.0030228032264858484, + "rewards/margins": -0.002682460006326437, + "rewards/rejected": 0.005705262999981642, + "step": 1270 + }, + { + "epoch": 0.22, + "learning_rate": 9.43073047858942e-08, + "logits/chosen": -2.7489657402038574, + "logits/rejected": -2.7751262187957764, + "logps/chosen": -260.9920349121094, + "logps/rejected": -214.2970733642578, + "loss": 0.6932, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": 0.00232306937687099, + "rewards/margins": -0.002894314704462886, + "rewards/rejected": 0.005217384081333876, + "step": 1280 + }, + { + "epoch": 0.23, + "learning_rate": 9.425692695214106e-08, + "logits/chosen": -2.7719390392303467, + "logits/rejected": -2.8384242057800293, + "logps/chosen": -253.56301879882812, + "logps/rejected": -174.05593872070312, + "loss": 0.6929, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.00489515345543623, + "rewards/margins": 0.0007793476688675582, + "rewards/rejected": 0.00411580502986908, + "step": 1290 + }, + { + "epoch": 0.23, + "learning_rate": 9.42065491183879e-08, + "logits/chosen": -2.787092447280884, + "logits/rejected": -2.73928165435791, + "logps/chosen": -230.39700317382812, + "logps/rejected": -205.6045684814453, + "loss": 0.693, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.004592005163431168, + "rewards/margins": 0.0004286689218133688, + "rewards/rejected": 0.004163335543125868, + "step": 1300 + }, + { + "epoch": 0.23, + "learning_rate": 9.415617128463475e-08, + "logits/chosen": -2.7811431884765625, + "logits/rejected": -2.778087615966797, + "logps/chosen": -242.17929077148438, + "logps/rejected": -206.31338500976562, + "loss": 0.6927, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0039786649867892265, + "rewards/margins": -0.0004098299832548946, + "rewards/rejected": 0.00438849488273263, + "step": 1310 + }, + { + "epoch": 0.23, + "learning_rate": 9.41057934508816e-08, + "logits/chosen": -2.6959187984466553, + "logits/rejected": -2.788710832595825, + "logps/chosen": -239.3393096923828, + "logps/rejected": -177.31842041015625, + "loss": 0.6925, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0030113484244793653, + "rewards/margins": 0.0008161927689798176, + "rewards/rejected": 0.0021951559465378523, + "step": 1320 + }, + { + "epoch": 0.23, + "learning_rate": 9.405541561712846e-08, + "logits/chosen": -2.8158926963806152, + "logits/rejected": -2.7934420108795166, + "logps/chosen": -246.5731964111328, + "logps/rejected": -215.53076171875, + "loss": 0.6925, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": 0.0015319122467190027, + "rewards/margins": -0.0007288408814929426, + "rewards/rejected": 0.0022607529535889626, + "step": 1330 + }, + { + "epoch": 0.23, + "learning_rate": 9.400503778337531e-08, + "logits/chosen": -2.648024320602417, + "logits/rejected": -2.6812193393707275, + "logps/chosen": -253.42678833007812, + "logps/rejected": -231.6710205078125, + "loss": 0.6928, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.006225033663213253, + "rewards/margins": 0.002081912010908127, + "rewards/rejected": 0.004143121186643839, + "step": 1340 + }, + { + "epoch": 0.24, + "learning_rate": 9.395465994962217e-08, + "logits/chosen": -2.7687926292419434, + "logits/rejected": -2.7247531414031982, + "logps/chosen": -198.0591278076172, + "logps/rejected": -180.5609893798828, + "loss": 0.6924, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.004522668197751045, + "rewards/margins": 0.0002378983626840636, + "rewards/rejected": 0.0042847697623074055, + "step": 1350 + }, + { + "epoch": 0.24, + "learning_rate": 9.390428211586902e-08, + "logits/chosen": -2.747763156890869, + "logits/rejected": -2.706991672515869, + "logps/chosen": -255.20736694335938, + "logps/rejected": -249.22946166992188, + "loss": 0.6927, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.003953252919018269, + "rewards/margins": -0.000359726749593392, + "rewards/rejected": 0.004312979988753796, + "step": 1360 + }, + { + "epoch": 0.24, + "learning_rate": 9.385390428211587e-08, + "logits/chosen": -2.7608680725097656, + "logits/rejected": -2.807486057281494, + "logps/chosen": -219.6439971923828, + "logps/rejected": -175.39483642578125, + "loss": 0.6927, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.002831274876371026, + "rewards/margins": 0.00012180556223029271, + "rewards/rejected": 0.0027094685938209295, + "step": 1370 + }, + { + "epoch": 0.24, + "learning_rate": 9.380352644836271e-08, + "logits/chosen": -2.713686466217041, + "logits/rejected": -2.7140908241271973, + "logps/chosen": -242.8909912109375, + "logps/rejected": -245.1560821533203, + "loss": 0.6929, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0032959680538624525, + "rewards/margins": -0.0015910521615296602, + "rewards/rejected": 0.004887019749730825, + "step": 1380 + }, + { + "epoch": 0.24, + "learning_rate": 9.375314861460957e-08, + "logits/chosen": -2.7107300758361816, + "logits/rejected": -2.703914165496826, + "logps/chosen": -230.3936767578125, + "logps/rejected": -253.17105102539062, + "loss": 0.6931, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.002635772805660963, + "rewards/margins": -0.0005686979275196791, + "rewards/rejected": 0.0032044709660112858, + "step": 1390 + }, + { + "epoch": 0.25, + "learning_rate": 9.370277078085642e-08, + "logits/chosen": -2.7594103813171387, + "logits/rejected": -2.766557455062866, + "logps/chosen": -224.17626953125, + "logps/rejected": -215.5638427734375, + "loss": 0.6927, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.005116119980812073, + "rewards/margins": 0.001255401293747127, + "rewards/rejected": 0.0038607188034802675, + "step": 1400 + }, + { + "epoch": 0.25, + "learning_rate": 9.365239294710328e-08, + "logits/chosen": -2.756953477859497, + "logits/rejected": -2.758610486984253, + "logps/chosen": -235.735107421875, + "logps/rejected": -188.66738891601562, + "loss": 0.6923, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.005391458515077829, + "rewards/margins": 0.0025972898583859205, + "rewards/rejected": 0.002794168423861265, + "step": 1410 + }, + { + "epoch": 0.25, + "learning_rate": 9.360201511335012e-08, + "logits/chosen": -2.655500888824463, + "logits/rejected": -2.6824567317962646, + "logps/chosen": -214.3753662109375, + "logps/rejected": -198.02159118652344, + "loss": 0.6925, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0019323080778121948, + "rewards/margins": 5.818065255880356e-05, + "rewards/rejected": 0.0018741274252533913, + "step": 1420 + }, + { + "epoch": 0.25, + "learning_rate": 9.355163727959697e-08, + "logits/chosen": -2.748979091644287, + "logits/rejected": -2.7408335208892822, + "logps/chosen": -218.5498046875, + "logps/rejected": -226.24478149414062, + "loss": 0.693, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.003222791478037834, + "rewards/margins": -0.0020806575194001198, + "rewards/rejected": 0.005303448997437954, + "step": 1430 + }, + { + "epoch": 0.25, + "learning_rate": 9.350125944584382e-08, + "logits/chosen": -2.83701229095459, + "logits/rejected": -2.812077283859253, + "logps/chosen": -219.4445343017578, + "logps/rejected": -199.6473846435547, + "loss": 0.6925, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.005975143052637577, + "rewards/margins": 0.0015650525456294417, + "rewards/rejected": 0.004410090856254101, + "step": 1440 + }, + { + "epoch": 0.25, + "learning_rate": 9.345088161209068e-08, + "logits/chosen": -2.7849693298339844, + "logits/rejected": -2.7290408611297607, + "logps/chosen": -208.5734405517578, + "logps/rejected": -195.73760986328125, + "loss": 0.6927, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.0017629098147153854, + "rewards/margins": -0.0009751931065693498, + "rewards/rejected": 0.0027381028048694134, + "step": 1450 + }, + { + "epoch": 0.26, + "learning_rate": 9.340050377833753e-08, + "logits/chosen": -2.7637295722961426, + "logits/rejected": -2.76435923576355, + "logps/chosen": -247.49789428710938, + "logps/rejected": -220.59597778320312, + "loss": 0.6925, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.007490481249988079, + "rewards/margins": 0.0033264905214309692, + "rewards/rejected": 0.00416399072855711, + "step": 1460 + }, + { + "epoch": 0.26, + "learning_rate": 9.335012594458438e-08, + "logits/chosen": -2.8603591918945312, + "logits/rejected": -2.8554975986480713, + "logps/chosen": -260.99822998046875, + "logps/rejected": -210.4870147705078, + "loss": 0.6927, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0044870320707559586, + "rewards/margins": 0.0010521438671275973, + "rewards/rejected": 0.003434887621551752, + "step": 1470 + }, + { + "epoch": 0.26, + "learning_rate": 9.329974811083124e-08, + "logits/chosen": -2.7806200981140137, + "logits/rejected": -2.780532121658325, + "logps/chosen": -220.0015106201172, + "logps/rejected": -210.1516571044922, + "loss": 0.6933, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.0038058434147387743, + "rewards/margins": -0.0014907947042956948, + "rewards/rejected": 0.005296637769788504, + "step": 1480 + }, + { + "epoch": 0.26, + "learning_rate": 9.324937027707808e-08, + "logits/chosen": -2.716339111328125, + "logits/rejected": -2.7717671394348145, + "logps/chosen": -222.77645874023438, + "logps/rejected": -188.9876708984375, + "loss": 0.6925, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.006295431405305862, + "rewards/margins": 0.001769342226907611, + "rewards/rejected": 0.004526089411228895, + "step": 1490 + }, + { + "epoch": 0.26, + "learning_rate": 9.319899244332493e-08, + "logits/chosen": -2.7848076820373535, + "logits/rejected": -2.763967990875244, + "logps/chosen": -258.8097839355469, + "logps/rejected": -231.8975372314453, + "loss": 0.6931, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.00430386234074831, + "rewards/margins": 0.000930764595977962, + "rewards/rejected": 0.0033730976283550262, + "step": 1500 + }, + { + "epoch": 0.26, + "learning_rate": 9.314861460957179e-08, + "logits/chosen": -2.7079567909240723, + "logits/rejected": -2.73983097076416, + "logps/chosen": -266.87939453125, + "logps/rejected": -215.9412078857422, + "loss": 0.6923, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.0085039883852005, + "rewards/margins": 0.0026515196077525616, + "rewards/rejected": 0.005852467846125364, + "step": 1510 + }, + { + "epoch": 0.27, + "learning_rate": 9.309823677581864e-08, + "logits/chosen": -2.796665668487549, + "logits/rejected": -2.7821192741394043, + "logps/chosen": -223.2317352294922, + "logps/rejected": -186.51785278320312, + "loss": 0.6927, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.00340632232837379, + "rewards/margins": 0.001166484085842967, + "rewards/rejected": 0.0022398384753614664, + "step": 1520 + }, + { + "epoch": 0.27, + "learning_rate": 9.304785894206548e-08, + "logits/chosen": -2.7554478645324707, + "logits/rejected": -2.720654010772705, + "logps/chosen": -242.2590789794922, + "logps/rejected": -228.3076171875, + "loss": 0.6928, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.006177330389618874, + "rewards/margins": 0.003083443734794855, + "rewards/rejected": 0.003093887586146593, + "step": 1530 + }, + { + "epoch": 0.27, + "learning_rate": 9.299748110831233e-08, + "logits/chosen": -2.735020875930786, + "logits/rejected": -2.69610595703125, + "logps/chosen": -235.02078247070312, + "logps/rejected": -209.3193817138672, + "loss": 0.6924, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": 0.003275824710726738, + "rewards/margins": -0.002175877569243312, + "rewards/rejected": 0.005451702047139406, + "step": 1540 + }, + { + "epoch": 0.27, + "learning_rate": 9.294710327455919e-08, + "logits/chosen": -2.7271084785461426, + "logits/rejected": -2.754586696624756, + "logps/chosen": -241.9888916015625, + "logps/rejected": -214.42196655273438, + "loss": 0.6921, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.006132029928267002, + "rewards/margins": 0.002107930602505803, + "rewards/rejected": 0.004024098627269268, + "step": 1550 + }, + { + "epoch": 0.27, + "learning_rate": 9.289672544080604e-08, + "logits/chosen": -2.7789578437805176, + "logits/rejected": -2.804396390914917, + "logps/chosen": -242.86337280273438, + "logps/rejected": -193.51954650878906, + "loss": 0.6928, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.005735357757657766, + "rewards/margins": 0.0003629502607509494, + "rewards/rejected": 0.0053724078461527824, + "step": 1560 + }, + { + "epoch": 0.28, + "learning_rate": 9.28463476070529e-08, + "logits/chosen": -2.7950856685638428, + "logits/rejected": -2.756988048553467, + "logps/chosen": -223.4980010986328, + "logps/rejected": -219.8987579345703, + "loss": 0.6921, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.004248038865625858, + "rewards/margins": 0.0013514070305973291, + "rewards/rejected": 0.002896632067859173, + "step": 1570 + }, + { + "epoch": 0.28, + "learning_rate": 9.279596977329975e-08, + "logits/chosen": -2.705752372741699, + "logits/rejected": -2.7348334789276123, + "logps/chosen": -230.68222045898438, + "logps/rejected": -227.8123321533203, + "loss": 0.6923, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.003918840549886227, + "rewards/margins": 0.0002412328467471525, + "rewards/rejected": 0.0036776072811335325, + "step": 1580 + }, + { + "epoch": 0.28, + "learning_rate": 9.27455919395466e-08, + "logits/chosen": -2.7165350914001465, + "logits/rejected": -2.7095649242401123, + "logps/chosen": -202.18948364257812, + "logps/rejected": -204.86062622070312, + "loss": 0.6927, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.0033042896538972855, + "rewards/margins": -0.0008645458146929741, + "rewards/rejected": 0.0041688354685902596, + "step": 1590 + }, + { + "epoch": 0.28, + "learning_rate": 9.269521410579345e-08, + "logits/chosen": -2.708650588989258, + "logits/rejected": -2.6804311275482178, + "logps/chosen": -204.07569885253906, + "logps/rejected": -151.32139587402344, + "loss": 0.6925, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.004048886708915234, + "rewards/margins": 0.0010695180390030146, + "rewards/rejected": 0.0029793691355735064, + "step": 1600 + }, + { + "epoch": 0.28, + "learning_rate": 9.26448362720403e-08, + "logits/chosen": -2.7520134449005127, + "logits/rejected": -2.7817509174346924, + "logps/chosen": -231.3147430419922, + "logps/rejected": -186.743896484375, + "loss": 0.6921, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.006745592691004276, + "rewards/margins": 0.0036534499377012253, + "rewards/rejected": 0.0030921432189643383, + "step": 1610 + }, + { + "epoch": 0.28, + "learning_rate": 9.259445843828715e-08, + "logits/chosen": -2.8089406490325928, + "logits/rejected": -2.804744243621826, + "logps/chosen": -294.253662109375, + "logps/rejected": -250.2303924560547, + "loss": 0.6923, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.008810626342892647, + "rewards/margins": 0.00140268518589437, + "rewards/rejected": 0.007407941855490208, + "step": 1620 + }, + { + "epoch": 0.29, + "learning_rate": 9.2544080604534e-08, + "logits/chosen": -2.788504123687744, + "logits/rejected": -2.818932294845581, + "logps/chosen": -204.68771362304688, + "logps/rejected": -171.62033081054688, + "loss": 0.6927, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.003130528377369046, + "rewards/margins": -0.0011326493695378304, + "rewards/rejected": 0.004263177514076233, + "step": 1630 + }, + { + "epoch": 0.29, + "learning_rate": 9.249370277078086e-08, + "logits/chosen": -2.75852632522583, + "logits/rejected": -2.810488700866699, + "logps/chosen": -293.2353820800781, + "logps/rejected": -233.1583709716797, + "loss": 0.693, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.005525670945644379, + "rewards/margins": 0.0027149529196321964, + "rewards/rejected": 0.002810717560350895, + "step": 1640 + }, + { + "epoch": 0.29, + "learning_rate": 9.24433249370277e-08, + "logits/chosen": -2.7465367317199707, + "logits/rejected": -2.7176971435546875, + "logps/chosen": -248.1861114501953, + "logps/rejected": -205.9281005859375, + "loss": 0.6924, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.007562885992228985, + "rewards/margins": 0.005088142119348049, + "rewards/rejected": 0.0024747434072196484, + "step": 1650 + }, + { + "epoch": 0.29, + "learning_rate": 9.239294710327455e-08, + "logits/chosen": -2.765758752822876, + "logits/rejected": -2.76737904548645, + "logps/chosen": -236.78482055664062, + "logps/rejected": -216.59408569335938, + "loss": 0.6925, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.00701189273968339, + "rewards/margins": 0.0009126948425546288, + "rewards/rejected": 0.006099197082221508, + "step": 1660 + }, + { + "epoch": 0.29, + "learning_rate": 9.23425692695214e-08, + "logits/chosen": -2.7198102474212646, + "logits/rejected": -2.676805257797241, + "logps/chosen": -190.41085815429688, + "logps/rejected": -199.9924774169922, + "loss": 0.6927, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.005398167297244072, + "rewards/margins": 0.0025181311648339033, + "rewards/rejected": 0.0028800363652408123, + "step": 1670 + }, + { + "epoch": 0.29, + "learning_rate": 9.229219143576826e-08, + "logits/chosen": -2.7450883388519287, + "logits/rejected": -2.7034592628479004, + "logps/chosen": -285.408935546875, + "logps/rejected": -261.0296936035156, + "loss": 0.6922, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.004709193948656321, + "rewards/margins": -0.00033829378662630916, + "rewards/rejected": 0.005047488491982222, + "step": 1680 + }, + { + "epoch": 0.3, + "learning_rate": 9.224181360201511e-08, + "logits/chosen": -2.6765735149383545, + "logits/rejected": -2.5730743408203125, + "logps/chosen": -218.64990234375, + "logps/rejected": -193.49989318847656, + "loss": 0.6929, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.005248272325843573, + "rewards/margins": 0.0031143042724579573, + "rewards/rejected": 0.002133968286216259, + "step": 1690 + }, + { + "epoch": 0.3, + "learning_rate": 9.219143576826196e-08, + "logits/chosen": -2.7516093254089355, + "logits/rejected": -2.796564817428589, + "logps/chosen": -259.0831298828125, + "logps/rejected": -185.15670776367188, + "loss": 0.6922, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.006098913960158825, + "rewards/margins": 0.0033921864815056324, + "rewards/rejected": 0.002706727711483836, + "step": 1700 + }, + { + "epoch": 0.3, + "learning_rate": 9.214105793450882e-08, + "logits/chosen": -2.8071539402008057, + "logits/rejected": -2.7718913555145264, + "logps/chosen": -237.6824188232422, + "logps/rejected": -192.46731567382812, + "loss": 0.6926, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.006562414113432169, + "rewards/margins": 0.0027120665181428194, + "rewards/rejected": 0.0038503475952893496, + "step": 1710 + }, + { + "epoch": 0.3, + "learning_rate": 9.209068010075567e-08, + "logits/chosen": -2.801098346710205, + "logits/rejected": -2.8045449256896973, + "logps/chosen": -306.48004150390625, + "logps/rejected": -233.9066162109375, + "loss": 0.6923, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.007683928124606609, + "rewards/margins": 0.003144733142107725, + "rewards/rejected": 0.004539194516837597, + "step": 1720 + }, + { + "epoch": 0.3, + "learning_rate": 9.204030226700251e-08, + "logits/chosen": -2.7108566761016846, + "logits/rejected": -2.805584669113159, + "logps/chosen": -190.70640563964844, + "logps/rejected": -164.53231811523438, + "loss": 0.6922, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.005603504832834005, + "rewards/margins": 0.0018408369505777955, + "rewards/rejected": 0.0037626686971634626, + "step": 1730 + }, + { + "epoch": 0.3, + "learning_rate": 9.198992443324937e-08, + "logits/chosen": -2.7416088581085205, + "logits/rejected": -2.7634804248809814, + "logps/chosen": -187.78787231445312, + "logps/rejected": -176.73611450195312, + "loss": 0.6928, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.003316228510811925, + "rewards/margins": -0.0012748127337545156, + "rewards/rejected": 0.004591041244566441, + "step": 1740 + }, + { + "epoch": 0.31, + "learning_rate": 9.193954659949622e-08, + "logits/chosen": -2.7573604583740234, + "logits/rejected": -2.685169219970703, + "logps/chosen": -220.46957397460938, + "logps/rejected": -186.6195831298828, + "loss": 0.6923, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.00505624245852232, + "rewards/margins": 0.0036626472137868404, + "rewards/rejected": 0.0013935946626588702, + "step": 1750 + }, + { + "epoch": 0.31, + "learning_rate": 9.188916876574306e-08, + "logits/chosen": -2.8284783363342285, + "logits/rejected": -2.7774031162261963, + "logps/chosen": -270.4326171875, + "logps/rejected": -247.10494995117188, + "loss": 0.6922, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.007807993330061436, + "rewards/margins": 0.003054631408303976, + "rewards/rejected": 0.004753361456096172, + "step": 1760 + }, + { + "epoch": 0.31, + "learning_rate": 9.183879093198991e-08, + "logits/chosen": -2.7399754524230957, + "logits/rejected": -2.783146619796753, + "logps/chosen": -237.53921508789062, + "logps/rejected": -206.88241577148438, + "loss": 0.6923, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.00769572239369154, + "rewards/margins": 0.0022291478235274553, + "rewards/rejected": 0.005466574802994728, + "step": 1770 + }, + { + "epoch": 0.31, + "learning_rate": 9.178841309823677e-08, + "logits/chosen": -2.716817855834961, + "logits/rejected": -2.719804286956787, + "logps/chosen": -235.63916015625, + "logps/rejected": -200.00222778320312, + "loss": 0.6924, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.006353571079671383, + "rewards/margins": 0.0007235562661662698, + "rewards/rejected": 0.00563001586124301, + "step": 1780 + }, + { + "epoch": 0.31, + "learning_rate": 9.173803526448362e-08, + "logits/chosen": -2.7352333068847656, + "logits/rejected": -2.7781901359558105, + "logps/chosen": -175.88961791992188, + "logps/rejected": -172.944091796875, + "loss": 0.6924, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.005051255226135254, + "rewards/margins": 0.00013072407455183566, + "rewards/rejected": 0.004920531529933214, + "step": 1790 + }, + { + "epoch": 0.32, + "learning_rate": 9.168765743073047e-08, + "logits/chosen": -2.737471342086792, + "logits/rejected": -2.71102237701416, + "logps/chosen": -250.81787109375, + "logps/rejected": -211.5341796875, + "loss": 0.6923, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.007261678576469421, + "rewards/margins": 0.0013637794181704521, + "rewards/rejected": 0.005897899158298969, + "step": 1800 + }, + { + "epoch": 0.32, + "learning_rate": 9.163727959697733e-08, + "logits/chosen": -2.7573001384735107, + "logits/rejected": -2.777223587036133, + "logps/chosen": -223.52700805664062, + "logps/rejected": -224.9475860595703, + "loss": 0.6925, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.005940387956798077, + "rewards/margins": 0.002223807852715254, + "rewards/rejected": 0.003716580104082823, + "step": 1810 + }, + { + "epoch": 0.32, + "learning_rate": 9.158690176322418e-08, + "logits/chosen": -2.7546377182006836, + "logits/rejected": -2.8038830757141113, + "logps/chosen": -210.6802215576172, + "logps/rejected": -191.94479370117188, + "loss": 0.6928, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.005436464212834835, + "rewards/margins": -0.0017134780064225197, + "rewards/rejected": 0.007149942219257355, + "step": 1820 + }, + { + "epoch": 0.32, + "learning_rate": 9.153652392947104e-08, + "logits/chosen": -2.793966293334961, + "logits/rejected": -2.84097957611084, + "logps/chosen": -275.74078369140625, + "logps/rejected": -247.7950439453125, + "loss": 0.6932, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.006203091703355312, + "rewards/margins": 0.0017260663444176316, + "rewards/rejected": 0.004477024544030428, + "step": 1830 + }, + { + "epoch": 0.32, + "learning_rate": 9.148614609571788e-08, + "logits/chosen": -2.7271361351013184, + "logits/rejected": -2.8027615547180176, + "logps/chosen": -197.15615844726562, + "logps/rejected": -185.2477264404297, + "loss": 0.6925, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.004695483483374119, + "rewards/margins": -0.0009570989641360939, + "rewards/rejected": 0.00565258227288723, + "step": 1840 + }, + { + "epoch": 0.32, + "learning_rate": 9.143576826196473e-08, + "logits/chosen": -2.6608946323394775, + "logits/rejected": -2.6794865131378174, + "logps/chosen": -248.6991729736328, + "logps/rejected": -243.78225708007812, + "loss": 0.6925, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.006408816669136286, + "rewards/margins": -0.0003214823664166033, + "rewards/rejected": 0.0067302994430065155, + "step": 1850 + }, + { + "epoch": 0.33, + "learning_rate": 9.138539042821158e-08, + "logits/chosen": -2.7787938117980957, + "logits/rejected": -2.773528575897217, + "logps/chosen": -276.1280212402344, + "logps/rejected": -227.1744842529297, + "loss": 0.6927, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.009555719792842865, + "rewards/margins": 0.003407822223380208, + "rewards/rejected": 0.006147897802293301, + "step": 1860 + }, + { + "epoch": 0.33, + "learning_rate": 9.133501259445844e-08, + "logits/chosen": -2.759768009185791, + "logits/rejected": -2.7878026962280273, + "logps/chosen": -282.8551330566406, + "logps/rejected": -236.4971160888672, + "loss": 0.6929, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.007030332926660776, + "rewards/margins": 0.0005596103728748858, + "rewards/rejected": 0.006470722146332264, + "step": 1870 + }, + { + "epoch": 0.33, + "learning_rate": 9.128463476070528e-08, + "logits/chosen": -2.7400457859039307, + "logits/rejected": -2.7290937900543213, + "logps/chosen": -228.9811248779297, + "logps/rejected": -190.52259826660156, + "loss": 0.6921, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.008042901754379272, + "rewards/margins": 0.004830832127481699, + "rewards/rejected": 0.00321206939406693, + "step": 1880 + }, + { + "epoch": 0.33, + "learning_rate": 9.123425692695213e-08, + "logits/chosen": -2.7177040576934814, + "logits/rejected": -2.746002197265625, + "logps/chosen": -208.7105255126953, + "logps/rejected": -178.6358642578125, + "loss": 0.6924, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.008034145459532738, + "rewards/margins": 0.0038532826583832502, + "rewards/rejected": 0.0041808634996414185, + "step": 1890 + }, + { + "epoch": 0.33, + "learning_rate": 9.118387909319898e-08, + "logits/chosen": -2.7194418907165527, + "logits/rejected": -2.7867624759674072, + "logps/chosen": -260.50518798828125, + "logps/rejected": -232.93331909179688, + "loss": 0.6923, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.009059436619281769, + "rewards/margins": 0.0009833091171458364, + "rewards/rejected": 0.008076125755906105, + "step": 1900 + }, + { + "epoch": 0.33, + "learning_rate": 9.113350125944584e-08, + "logits/chosen": -2.6974074840545654, + "logits/rejected": -2.720205545425415, + "logps/chosen": -229.29800415039062, + "logps/rejected": -222.5083465576172, + "loss": 0.6927, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.006830728612840176, + "rewards/margins": 9.487769420957193e-05, + "rewards/rejected": 0.006735851056873798, + "step": 1910 + }, + { + "epoch": 0.34, + "learning_rate": 9.108312342569269e-08, + "logits/chosen": -2.682278633117676, + "logits/rejected": -2.689655303955078, + "logps/chosen": -262.4538879394531, + "logps/rejected": -208.20834350585938, + "loss": 0.6922, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.008090605027973652, + "rewards/margins": 0.005382605362683535, + "rewards/rejected": 0.0027079996652901173, + "step": 1920 + }, + { + "epoch": 0.34, + "learning_rate": 9.103274559193955e-08, + "logits/chosen": -2.655890703201294, + "logits/rejected": -2.764970541000366, + "logps/chosen": -277.8880310058594, + "logps/rejected": -202.5020751953125, + "loss": 0.6928, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.007924163714051247, + "rewards/margins": 0.0037231750320643187, + "rewards/rejected": 0.004200988449156284, + "step": 1930 + }, + { + "epoch": 0.34, + "learning_rate": 9.09823677581864e-08, + "logits/chosen": -2.7730414867401123, + "logits/rejected": -2.708861827850342, + "logps/chosen": -233.4267578125, + "logps/rejected": -205.75045776367188, + "loss": 0.6928, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.007474385201931, + "rewards/margins": 0.0025435371790081263, + "rewards/rejected": 0.00493084779009223, + "step": 1940 + }, + { + "epoch": 0.34, + "learning_rate": 9.093198992443325e-08, + "logits/chosen": -2.7270901203155518, + "logits/rejected": -2.7830066680908203, + "logps/chosen": -269.06103515625, + "logps/rejected": -233.0624237060547, + "loss": 0.6924, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.006805942859500647, + "rewards/margins": 0.002863366389647126, + "rewards/rejected": 0.003942577634006739, + "step": 1950 + }, + { + "epoch": 0.34, + "learning_rate": 9.088161209068009e-08, + "logits/chosen": -2.756842851638794, + "logits/rejected": -2.7270755767822266, + "logps/chosen": -205.07064819335938, + "logps/rejected": -199.98719787597656, + "loss": 0.6924, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.006842183880507946, + "rewards/margins": 0.0016147240530699492, + "rewards/rejected": 0.0052274600602686405, + "step": 1960 + }, + { + "epoch": 0.35, + "learning_rate": 9.083123425692695e-08, + "logits/chosen": -2.772458076477051, + "logits/rejected": -2.720886707305908, + "logps/chosen": -222.73904418945312, + "logps/rejected": -192.80467224121094, + "loss": 0.6925, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.008435122668743134, + "rewards/margins": 0.0015853416407480836, + "rewards/rejected": 0.006849782075732946, + "step": 1970 + }, + { + "epoch": 0.35, + "learning_rate": 9.07808564231738e-08, + "logits/chosen": -2.8323588371276855, + "logits/rejected": -2.757342576980591, + "logps/chosen": -221.9827117919922, + "logps/rejected": -206.13693237304688, + "loss": 0.6925, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.006544102914631367, + "rewards/margins": 0.0011714848224073648, + "rewards/rejected": 0.005372617393732071, + "step": 1980 + }, + { + "epoch": 0.35, + "learning_rate": 9.073047858942065e-08, + "logits/chosen": -2.839995861053467, + "logits/rejected": -2.778444290161133, + "logps/chosen": -198.0923309326172, + "logps/rejected": -185.09725952148438, + "loss": 0.692, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.00797742698341608, + "rewards/margins": 0.0033867559395730495, + "rewards/rejected": 0.004590670112520456, + "step": 1990 + }, + { + "epoch": 0.35, + "learning_rate": 9.06801007556675e-08, + "logits/chosen": -2.7065186500549316, + "logits/rejected": -2.6786417961120605, + "logps/chosen": -200.3252716064453, + "logps/rejected": -174.55252075195312, + "loss": 0.6927, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0027497578412294388, + "rewards/margins": 0.00032762327464297414, + "rewards/rejected": 0.002422134391963482, + "step": 2000 + }, + { + "epoch": 0.35, + "learning_rate": 9.062972292191435e-08, + "logits/chosen": -2.8198843002319336, + "logits/rejected": -2.72586727142334, + "logps/chosen": -250.848388671875, + "logps/rejected": -223.4097900390625, + "loss": 0.692, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.010807116515934467, + "rewards/margins": 0.0031298950780183077, + "rewards/rejected": 0.007677220739424229, + "step": 2010 + }, + { + "epoch": 0.35, + "learning_rate": 9.05793450881612e-08, + "logits/chosen": -2.7961342334747314, + "logits/rejected": -2.793257713317871, + "logps/chosen": -228.30099487304688, + "logps/rejected": -172.77639770507812, + "loss": 0.6922, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.00609872629866004, + "rewards/margins": 0.0020499066449701786, + "rewards/rejected": 0.004048819653689861, + "step": 2020 + }, + { + "epoch": 0.36, + "learning_rate": 9.052896725440806e-08, + "logits/chosen": -2.773071765899658, + "logits/rejected": -2.726912260055542, + "logps/chosen": -210.5772705078125, + "logps/rejected": -182.91647338867188, + "loss": 0.6918, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.008080719970166683, + "rewards/margins": 0.002562993671745062, + "rewards/rejected": 0.005517727229744196, + "step": 2030 + }, + { + "epoch": 0.36, + "learning_rate": 9.047858942065491e-08, + "logits/chosen": -2.694596767425537, + "logits/rejected": -2.707979917526245, + "logps/chosen": -219.9010772705078, + "logps/rejected": -220.4337158203125, + "loss": 0.6923, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.007597730960696936, + "rewards/margins": -0.0006745406426489353, + "rewards/rejected": 0.008272271603345871, + "step": 2040 + }, + { + "epoch": 0.36, + "learning_rate": 9.042821158690176e-08, + "logits/chosen": -2.823132276535034, + "logits/rejected": -2.8142189979553223, + "logps/chosen": -229.84036254882812, + "logps/rejected": -180.3568572998047, + "loss": 0.6922, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.00825478509068489, + "rewards/margins": 0.00363583629950881, + "rewards/rejected": 0.004618949256837368, + "step": 2050 + }, + { + "epoch": 0.36, + "learning_rate": 9.037783375314862e-08, + "logits/chosen": -2.7286908626556396, + "logits/rejected": -2.7378149032592773, + "logps/chosen": -174.80532836914062, + "logps/rejected": -159.1217803955078, + "loss": 0.6924, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.005188413895666599, + "rewards/margins": 0.001207556575536728, + "rewards/rejected": 0.003980856854468584, + "step": 2060 + }, + { + "epoch": 0.36, + "learning_rate": 9.032745591939546e-08, + "logits/chosen": -2.7917840480804443, + "logits/rejected": -2.7678382396698, + "logps/chosen": -211.1044921875, + "logps/rejected": -186.33775329589844, + "loss": 0.6922, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.006869046948850155, + "rewards/margins": 0.002652390394359827, + "rewards/rejected": 0.004216657020151615, + "step": 2070 + }, + { + "epoch": 0.36, + "learning_rate": 9.027707808564231e-08, + "logits/chosen": -2.773383617401123, + "logits/rejected": -2.7457468509674072, + "logps/chosen": -196.5582733154297, + "logps/rejected": -157.29763793945312, + "loss": 0.6931, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.004717974923551083, + "rewards/margins": -0.0003334479406476021, + "rewards/rejected": 0.005051423329859972, + "step": 2080 + }, + { + "epoch": 0.37, + "learning_rate": 9.022670025188916e-08, + "logits/chosen": -2.829695224761963, + "logits/rejected": -2.8286352157592773, + "logps/chosen": -257.33575439453125, + "logps/rejected": -222.24081420898438, + "loss": 0.693, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.008855994790792465, + "rewards/margins": -0.0004033507429994643, + "rewards/rejected": 0.009259345009922981, + "step": 2090 + }, + { + "epoch": 0.37, + "learning_rate": 9.017632241813602e-08, + "logits/chosen": -2.6822662353515625, + "logits/rejected": -2.7216250896453857, + "logps/chosen": -204.204345703125, + "logps/rejected": -213.64120483398438, + "loss": 0.6925, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.005887551233172417, + "rewards/margins": -0.001325045945122838, + "rewards/rejected": 0.007212596945464611, + "step": 2100 + }, + { + "epoch": 0.37, + "learning_rate": 9.012594458438286e-08, + "logits/chosen": -2.717801332473755, + "logits/rejected": -2.6509881019592285, + "logps/chosen": -201.35829162597656, + "logps/rejected": -204.86557006835938, + "loss": 0.6931, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.005306928418576717, + "rewards/margins": -0.0017324115615338087, + "rewards/rejected": 0.007039339747279882, + "step": 2110 + }, + { + "epoch": 0.37, + "learning_rate": 9.007556675062971e-08, + "logits/chosen": -2.7330944538116455, + "logits/rejected": -2.7502284049987793, + "logps/chosen": -235.6743621826172, + "logps/rejected": -227.54446411132812, + "loss": 0.6923, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.007282434497028589, + "rewards/margins": 0.0004998206277377903, + "rewards/rejected": 0.006782613694667816, + "step": 2120 + }, + { + "epoch": 0.37, + "learning_rate": 9.002518891687657e-08, + "logits/chosen": -2.7793288230895996, + "logits/rejected": -2.7879912853240967, + "logps/chosen": -244.0114288330078, + "logps/rejected": -195.60763549804688, + "loss": 0.6928, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.00913340412080288, + "rewards/margins": 0.002795944456011057, + "rewards/rejected": 0.006337459199130535, + "step": 2130 + }, + { + "epoch": 0.37, + "learning_rate": 8.997481108312342e-08, + "logits/chosen": -2.770501136779785, + "logits/rejected": -2.75308895111084, + "logps/chosen": -263.10198974609375, + "logps/rejected": -227.291015625, + "loss": 0.6928, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.005692030768841505, + "rewards/margins": -0.001495410455390811, + "rewards/rejected": 0.007187440060079098, + "step": 2140 + }, + { + "epoch": 0.38, + "learning_rate": 8.992443324937027e-08, + "logits/chosen": -2.722250461578369, + "logits/rejected": -2.782747745513916, + "logps/chosen": -217.0636444091797, + "logps/rejected": -190.8524627685547, + "loss": 0.6923, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.0067198313772678375, + "rewards/margins": 0.00041137990774586797, + "rewards/rejected": 0.006308451294898987, + "step": 2150 + }, + { + "epoch": 0.38, + "learning_rate": 8.987405541561713e-08, + "logits/chosen": -2.792790651321411, + "logits/rejected": -2.831502676010132, + "logps/chosen": -235.6027069091797, + "logps/rejected": -213.80899047851562, + "loss": 0.6922, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.006459805183112621, + "rewards/margins": 0.0006882447050884366, + "rewards/rejected": 0.005771561060100794, + "step": 2160 + }, + { + "epoch": 0.38, + "learning_rate": 8.982367758186398e-08, + "logits/chosen": -2.6963181495666504, + "logits/rejected": -2.763627529144287, + "logps/chosen": -216.1712646484375, + "logps/rejected": -189.81759643554688, + "loss": 0.6921, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.008661460131406784, + "rewards/margins": 0.00203773588873446, + "rewards/rejected": 0.006623723544180393, + "step": 2170 + }, + { + "epoch": 0.38, + "learning_rate": 8.977329974811083e-08, + "logits/chosen": -2.735170364379883, + "logits/rejected": -2.7084457874298096, + "logps/chosen": -182.16720581054688, + "logps/rejected": -163.56094360351562, + "loss": 0.6927, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.008674652315676212, + "rewards/margins": 0.003342932555824518, + "rewards/rejected": 0.0053317188285291195, + "step": 2180 + }, + { + "epoch": 0.38, + "learning_rate": 8.972292191435767e-08, + "logits/chosen": -2.750704288482666, + "logits/rejected": -2.779202938079834, + "logps/chosen": -241.536865234375, + "logps/rejected": -190.92633056640625, + "loss": 0.6928, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.010668774135410786, + "rewards/margins": 0.0013826647773385048, + "rewards/rejected": 0.009286109358072281, + "step": 2190 + }, + { + "epoch": 0.39, + "learning_rate": 8.967254408060453e-08, + "logits/chosen": -2.7246861457824707, + "logits/rejected": -2.675992488861084, + "logps/chosen": -223.83837890625, + "logps/rejected": -188.50747680664062, + "loss": 0.6919, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.007452371530234814, + "rewards/margins": -0.0014652060344815254, + "rewards/rejected": 0.008917578496038914, + "step": 2200 + }, + { + "epoch": 0.39, + "learning_rate": 8.962216624685138e-08, + "logits/chosen": -2.7461745738983154, + "logits/rejected": -2.690744400024414, + "logps/chosen": -201.64651489257812, + "logps/rejected": -210.37405395507812, + "loss": 0.6927, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.005704388953745365, + "rewards/margins": -0.00024541860329918563, + "rewards/rejected": 0.005949807353317738, + "step": 2210 + }, + { + "epoch": 0.39, + "learning_rate": 8.957178841309823e-08, + "logits/chosen": -2.8038201332092285, + "logits/rejected": -2.75268816947937, + "logps/chosen": -254.98904418945312, + "logps/rejected": -221.23080444335938, + "loss": 0.6925, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.009008856490254402, + "rewards/margins": 0.0005879864911548793, + "rewards/rejected": 0.008420869708061218, + "step": 2220 + }, + { + "epoch": 0.39, + "learning_rate": 8.952141057934508e-08, + "logits/chosen": -2.804844617843628, + "logits/rejected": -2.805863380432129, + "logps/chosen": -242.4755859375, + "logps/rejected": -208.1300048828125, + "loss": 0.6921, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.008145569823682308, + "rewards/margins": 0.0016121035441756248, + "rewards/rejected": 0.006533467210829258, + "step": 2230 + }, + { + "epoch": 0.39, + "learning_rate": 8.947103274559193e-08, + "logits/chosen": -2.7161951065063477, + "logits/rejected": -2.6106388568878174, + "logps/chosen": -236.38534545898438, + "logps/rejected": -237.8708038330078, + "loss": 0.6921, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.01004200428724289, + "rewards/margins": 0.004435664042830467, + "rewards/rejected": 0.0056063407100737095, + "step": 2240 + }, + { + "epoch": 0.39, + "learning_rate": 8.942065491183878e-08, + "logits/chosen": -2.7104029655456543, + "logits/rejected": -2.7299609184265137, + "logps/chosen": -244.9352569580078, + "logps/rejected": -201.58877563476562, + "loss": 0.6926, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.008890941739082336, + "rewards/margins": 0.0025217377115041018, + "rewards/rejected": 0.006369204260408878, + "step": 2250 + }, + { + "epoch": 0.4, + "learning_rate": 8.937027707808565e-08, + "logits/chosen": -2.7342441082000732, + "logits/rejected": -2.7766692638397217, + "logps/chosen": -249.001708984375, + "logps/rejected": -195.75601196289062, + "loss": 0.6924, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.011680737137794495, + "rewards/margins": 0.007096041925251484, + "rewards/rejected": 0.004584694746881723, + "step": 2260 + }, + { + "epoch": 0.4, + "learning_rate": 8.931989924433249e-08, + "logits/chosen": -2.7314367294311523, + "logits/rejected": -2.751647472381592, + "logps/chosen": -257.7462158203125, + "logps/rejected": -192.61325073242188, + "loss": 0.6914, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.009932273998856544, + "rewards/margins": 0.002873816527426243, + "rewards/rejected": 0.007058457471430302, + "step": 2270 + }, + { + "epoch": 0.4, + "learning_rate": 8.926952141057934e-08, + "logits/chosen": -2.7829346656799316, + "logits/rejected": -2.6927618980407715, + "logps/chosen": -214.0055389404297, + "logps/rejected": -167.7479705810547, + "loss": 0.6918, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.01033037155866623, + "rewards/margins": 0.006925082765519619, + "rewards/rejected": 0.003405289025977254, + "step": 2280 + }, + { + "epoch": 0.4, + "learning_rate": 8.92191435768262e-08, + "logits/chosen": -2.7139039039611816, + "logits/rejected": -2.74005389213562, + "logps/chosen": -240.3031768798828, + "logps/rejected": -191.8223419189453, + "loss": 0.6925, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.006939934100955725, + "rewards/margins": 0.0009533121483400464, + "rewards/rejected": 0.0059866225346922874, + "step": 2290 + }, + { + "epoch": 0.4, + "learning_rate": 8.916876574307305e-08, + "logits/chosen": -2.7282981872558594, + "logits/rejected": -2.712113380432129, + "logps/chosen": -237.7392578125, + "logps/rejected": -224.4556427001953, + "loss": 0.692, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.010463756509125233, + "rewards/margins": 0.004110955633223057, + "rewards/rejected": 0.006352802272886038, + "step": 2300 + }, + { + "epoch": 0.4, + "learning_rate": 8.911838790931989e-08, + "logits/chosen": -2.7684943675994873, + "logits/rejected": -2.7373266220092773, + "logps/chosen": -206.5482635498047, + "logps/rejected": -212.13406372070312, + "loss": 0.6925, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.006885471288114786, + "rewards/margins": -0.002132121007889509, + "rewards/rejected": 0.009017592296004295, + "step": 2310 + }, + { + "epoch": 0.41, + "learning_rate": 8.906801007556674e-08, + "logits/chosen": -2.805568218231201, + "logits/rejected": -2.8355040550231934, + "logps/chosen": -275.70587158203125, + "logps/rejected": -209.14218139648438, + "loss": 0.6926, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.007967405952513218, + "rewards/margins": 0.002225789474323392, + "rewards/rejected": 0.00574161671102047, + "step": 2320 + }, + { + "epoch": 0.41, + "learning_rate": 8.90176322418136e-08, + "logits/chosen": -2.7412164211273193, + "logits/rejected": -2.7422406673431396, + "logps/chosen": -244.7394256591797, + "logps/rejected": -208.07717895507812, + "loss": 0.6924, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.00783600378781557, + "rewards/margins": 0.0005075406515970826, + "rewards/rejected": 0.007328461855649948, + "step": 2330 + }, + { + "epoch": 0.41, + "learning_rate": 8.896725440806045e-08, + "logits/chosen": -2.8028624057769775, + "logits/rejected": -2.796525716781616, + "logps/chosen": -272.66632080078125, + "logps/rejected": -222.811279296875, + "loss": 0.6921, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.010351276025176048, + "rewards/margins": 0.0018881557043641806, + "rewards/rejected": 0.008463121019303799, + "step": 2340 + }, + { + "epoch": 0.41, + "learning_rate": 8.891687657430729e-08, + "logits/chosen": -2.6541576385498047, + "logits/rejected": -2.686614751815796, + "logps/chosen": -231.4371337890625, + "logps/rejected": -216.7913818359375, + "loss": 0.6924, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.0074166180565953255, + "rewards/margins": -0.0016186184948310256, + "rewards/rejected": 0.009035235270857811, + "step": 2350 + }, + { + "epoch": 0.41, + "learning_rate": 8.886649874055415e-08, + "logits/chosen": -2.631671190261841, + "logits/rejected": -2.760439395904541, + "logps/chosen": -225.0189666748047, + "logps/rejected": -235.6808624267578, + "loss": 0.6929, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.007628731429576874, + "rewards/margins": -0.00035653618397191167, + "rewards/rejected": 0.007985267788171768, + "step": 2360 + }, + { + "epoch": 0.42, + "learning_rate": 8.881612090680101e-08, + "logits/chosen": -2.6786155700683594, + "logits/rejected": -2.7173733711242676, + "logps/chosen": -220.6988983154297, + "logps/rejected": -195.98582458496094, + "loss": 0.6922, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.009033399634063244, + "rewards/margins": 0.0017579678678885102, + "rewards/rejected": 0.007275431416928768, + "step": 2370 + }, + { + "epoch": 0.42, + "learning_rate": 8.876574307304785e-08, + "logits/chosen": -2.774136543273926, + "logits/rejected": -2.6647706031799316, + "logps/chosen": -304.55181884765625, + "logps/rejected": -307.3960876464844, + "loss": 0.6923, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.012085049413144588, + "rewards/margins": 0.0007154010236263275, + "rewards/rejected": 0.01136965025216341, + "step": 2380 + }, + { + "epoch": 0.42, + "learning_rate": 8.871536523929471e-08, + "logits/chosen": -2.6545538902282715, + "logits/rejected": -2.752094030380249, + "logps/chosen": -250.7977752685547, + "logps/rejected": -221.78964233398438, + "loss": 0.6922, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.008444622159004211, + "rewards/margins": 0.0009982278570532799, + "rewards/rejected": 0.0074463943019509315, + "step": 2390 + }, + { + "epoch": 0.42, + "learning_rate": 8.866498740554156e-08, + "logits/chosen": -2.7769970893859863, + "logits/rejected": -2.749866485595703, + "logps/chosen": -210.654541015625, + "logps/rejected": -191.4696807861328, + "loss": 0.6921, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.008832408115267754, + "rewards/margins": -0.0005183859029784799, + "rewards/rejected": 0.009350794367492199, + "step": 2400 + }, + { + "epoch": 0.42, + "learning_rate": 8.861460957178841e-08, + "logits/chosen": -2.697442054748535, + "logits/rejected": -2.7253782749176025, + "logps/chosen": -220.7960968017578, + "logps/rejected": -217.39108276367188, + "loss": 0.6921, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.0069009833969175816, + "rewards/margins": -0.0006977998418733478, + "rewards/rejected": 0.007598782889544964, + "step": 2410 + }, + { + "epoch": 0.42, + "learning_rate": 8.856423173803525e-08, + "logits/chosen": -2.7221148014068604, + "logits/rejected": -2.731081962585449, + "logps/chosen": -213.35916137695312, + "logps/rejected": -180.56887817382812, + "loss": 0.6921, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.006449718959629536, + "rewards/margins": 0.00094635970890522, + "rewards/rejected": 0.005503358785063028, + "step": 2420 + }, + { + "epoch": 0.43, + "learning_rate": 8.851385390428211e-08, + "logits/chosen": -2.726142644882202, + "logits/rejected": -2.7781872749328613, + "logps/chosen": -233.19851684570312, + "logps/rejected": -214.63565063476562, + "loss": 0.6923, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.009057990275323391, + "rewards/margins": 0.00277666375041008, + "rewards/rejected": 0.006281326524913311, + "step": 2430 + }, + { + "epoch": 0.43, + "learning_rate": 8.846347607052896e-08, + "logits/chosen": -2.721498966217041, + "logits/rejected": -2.74996018409729, + "logps/chosen": -246.1979217529297, + "logps/rejected": -196.91104125976562, + "loss": 0.6918, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.009174585342407227, + "rewards/margins": 0.002294916193932295, + "rewards/rejected": 0.00687966775149107, + "step": 2440 + }, + { + "epoch": 0.43, + "learning_rate": 8.841309823677582e-08, + "logits/chosen": -2.7128663063049316, + "logits/rejected": -2.6650452613830566, + "logps/chosen": -206.5331573486328, + "logps/rejected": -173.64071655273438, + "loss": 0.6924, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.007573836483061314, + "rewards/margins": 0.0018665831303223968, + "rewards/rejected": 0.005707253236323595, + "step": 2450 + }, + { + "epoch": 0.43, + "learning_rate": 8.836272040302266e-08, + "logits/chosen": -2.788109302520752, + "logits/rejected": -2.7255702018737793, + "logps/chosen": -243.81491088867188, + "logps/rejected": -197.00755310058594, + "loss": 0.6926, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.010449462570250034, + "rewards/margins": 0.003042304888367653, + "rewards/rejected": 0.007407157216221094, + "step": 2460 + }, + { + "epoch": 0.43, + "learning_rate": 8.831234256926951e-08, + "logits/chosen": -2.745732307434082, + "logits/rejected": -2.720219135284424, + "logps/chosen": -210.3990478515625, + "logps/rejected": -215.95071411132812, + "loss": 0.6925, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.007016859017312527, + "rewards/margins": 0.0003235770855098963, + "rewards/rejected": 0.006693282164633274, + "step": 2470 + }, + { + "epoch": 0.43, + "learning_rate": 8.826196473551638e-08, + "logits/chosen": -2.744358539581299, + "logits/rejected": -2.735334873199463, + "logps/chosen": -184.0402374267578, + "logps/rejected": -155.08839416503906, + "loss": 0.6924, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": 0.00902140885591507, + "rewards/margins": 0.004157154820859432, + "rewards/rejected": 0.004864254035055637, + "step": 2480 + }, + { + "epoch": 0.44, + "learning_rate": 8.821158690176323e-08, + "logits/chosen": -2.7525582313537598, + "logits/rejected": -2.7596418857574463, + "logps/chosen": -218.2732391357422, + "logps/rejected": -201.02366638183594, + "loss": 0.6921, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.01294918917119503, + "rewards/margins": 0.0058312080800533295, + "rewards/rejected": 0.00711798295378685, + "step": 2490 + }, + { + "epoch": 0.44, + "learning_rate": 8.816120906801007e-08, + "logits/chosen": -2.754030466079712, + "logits/rejected": -2.7371068000793457, + "logps/chosen": -214.6430206298828, + "logps/rejected": -185.87380981445312, + "loss": 0.6921, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.01002354547381401, + "rewards/margins": 0.0026681842282414436, + "rewards/rejected": 0.00735536077991128, + "step": 2500 + }, + { + "epoch": 0.44, + "learning_rate": 8.811083123425692e-08, + "logits/chosen": -2.768505096435547, + "logits/rejected": -2.7552056312561035, + "logps/chosen": -227.3952178955078, + "logps/rejected": -212.49172973632812, + "loss": 0.6925, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.008513586595654488, + "rewards/margins": 0.001957664964720607, + "rewards/rejected": 0.006555921398103237, + "step": 2510 + }, + { + "epoch": 0.44, + "learning_rate": 8.806045340050378e-08, + "logits/chosen": -2.7537245750427246, + "logits/rejected": -2.755566120147705, + "logps/chosen": -294.26031494140625, + "logps/rejected": -249.40060424804688, + "loss": 0.6924, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.014117250218987465, + "rewards/margins": 0.0032351291738450527, + "rewards/rejected": 0.0108821215108037, + "step": 2520 + }, + { + "epoch": 0.44, + "learning_rate": 8.801007556675063e-08, + "logits/chosen": -2.787724018096924, + "logits/rejected": -2.756760835647583, + "logps/chosen": -284.3551330566406, + "logps/rejected": -223.2763671875, + "loss": 0.6927, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.009325772523880005, + "rewards/margins": 0.0031861222814768553, + "rewards/rejected": 0.006139650940895081, + "step": 2530 + }, + { + "epoch": 0.44, + "learning_rate": 8.795969773299747e-08, + "logits/chosen": -2.672646999359131, + "logits/rejected": -2.7240772247314453, + "logps/chosen": -194.29666137695312, + "logps/rejected": -166.72015380859375, + "loss": 0.6921, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.009259345009922981, + "rewards/margins": 0.002904356922954321, + "rewards/rejected": 0.006354988552629948, + "step": 2540 + }, + { + "epoch": 0.45, + "learning_rate": 8.790931989924433e-08, + "logits/chosen": -2.6944260597229004, + "logits/rejected": -2.743349552154541, + "logps/chosen": -232.59182739257812, + "logps/rejected": -204.32626342773438, + "loss": 0.6916, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.010777676478028297, + "rewards/margins": 0.002251842524856329, + "rewards/rejected": 0.00852583535015583, + "step": 2550 + }, + { + "epoch": 0.45, + "learning_rate": 8.785894206549118e-08, + "logits/chosen": -2.6557891368865967, + "logits/rejected": -2.734790325164795, + "logps/chosen": -276.6233825683594, + "logps/rejected": -263.9059753417969, + "loss": 0.6928, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.011154399253427982, + "rewards/margins": 0.002435199683532119, + "rewards/rejected": 0.008719200268387794, + "step": 2560 + }, + { + "epoch": 0.45, + "learning_rate": 8.780856423173803e-08, + "logits/chosen": -2.7870709896087646, + "logits/rejected": -2.7531352043151855, + "logps/chosen": -197.4013671875, + "logps/rejected": -182.07659912109375, + "loss": 0.693, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.008912255987524986, + "rewards/margins": 0.00424787774682045, + "rewards/rejected": 0.004664379172027111, + "step": 2570 + }, + { + "epoch": 0.45, + "learning_rate": 8.775818639798487e-08, + "logits/chosen": -2.7127013206481934, + "logits/rejected": -2.784416437149048, + "logps/chosen": -247.58114624023438, + "logps/rejected": -234.8740997314453, + "loss": 0.6924, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.00897514633834362, + "rewards/margins": 0.0012818890390917659, + "rewards/rejected": 0.0076932585798203945, + "step": 2580 + }, + { + "epoch": 0.45, + "learning_rate": 8.770780856423174e-08, + "logits/chosen": -2.750242233276367, + "logits/rejected": -2.770826578140259, + "logps/chosen": -231.67666625976562, + "logps/rejected": -193.50149536132812, + "loss": 0.6921, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.007797654718160629, + "rewards/margins": 0.0008120322600007057, + "rewards/rejected": 0.006985623389482498, + "step": 2590 + }, + { + "epoch": 0.46, + "learning_rate": 8.765743073047859e-08, + "logits/chosen": -2.7939043045043945, + "logits/rejected": -2.732703685760498, + "logps/chosen": -181.970458984375, + "logps/rejected": -197.69735717773438, + "loss": 0.6921, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.008163347840309143, + "rewards/margins": 3.1356001272797585e-05, + "rewards/rejected": 0.00813199020922184, + "step": 2600 + }, + { + "epoch": 0.46, + "learning_rate": 8.760705289672545e-08, + "logits/chosen": -2.7721047401428223, + "logits/rejected": -2.727365016937256, + "logps/chosen": -208.9429473876953, + "logps/rejected": -212.2381134033203, + "loss": 0.6921, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.008429192937910557, + "rewards/margins": 0.002313527511432767, + "rewards/rejected": 0.006115665193647146, + "step": 2610 + }, + { + "epoch": 0.46, + "learning_rate": 8.755667506297229e-08, + "logits/chosen": -2.7597005367279053, + "logits/rejected": -2.754197597503662, + "logps/chosen": -199.6351318359375, + "logps/rejected": -197.25167846679688, + "loss": 0.6919, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.008318079635500908, + "rewards/margins": -0.001612034859135747, + "rewards/rejected": 0.009930115193128586, + "step": 2620 + }, + { + "epoch": 0.46, + "learning_rate": 8.750629722921914e-08, + "logits/chosen": -2.7147693634033203, + "logits/rejected": -2.7820794582366943, + "logps/chosen": -217.3456573486328, + "logps/rejected": -171.41885375976562, + "loss": 0.6921, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.007606199476867914, + "rewards/margins": -0.00042509473860263824, + "rewards/rejected": 0.008031293749809265, + "step": 2630 + }, + { + "epoch": 0.46, + "learning_rate": 8.7455919395466e-08, + "logits/chosen": -2.7982594966888428, + "logits/rejected": -2.821972608566284, + "logps/chosen": -213.735107421875, + "logps/rejected": -194.77943420410156, + "loss": 0.6923, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.007399165071547031, + "rewards/margins": 0.0010075327008962631, + "rewards/rejected": 0.006391631904989481, + "step": 2640 + }, + { + "epoch": 0.46, + "learning_rate": 8.740554156171285e-08, + "logits/chosen": -2.8446202278137207, + "logits/rejected": -2.813603162765503, + "logps/chosen": -252.73654174804688, + "logps/rejected": -244.2529754638672, + "loss": 0.6924, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.012703513726592064, + "rewards/margins": 0.0044145723804831505, + "rewards/rejected": 0.008288940414786339, + "step": 2650 + }, + { + "epoch": 0.47, + "learning_rate": 8.735516372795969e-08, + "logits/chosen": -2.6939728260040283, + "logits/rejected": -2.7148683071136475, + "logps/chosen": -245.3076629638672, + "logps/rejected": -201.79263305664062, + "loss": 0.6918, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.012571310624480247, + "rewards/margins": 0.004034299403429031, + "rewards/rejected": 0.008537010289728642, + "step": 2660 + }, + { + "epoch": 0.47, + "learning_rate": 8.730478589420654e-08, + "logits/chosen": -2.7818963527679443, + "logits/rejected": -2.770908832550049, + "logps/chosen": -262.9079895019531, + "logps/rejected": -277.7655334472656, + "loss": 0.6919, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.013273214921355247, + "rewards/margins": 0.003978852182626724, + "rewards/rejected": 0.009294363670051098, + "step": 2670 + }, + { + "epoch": 0.47, + "learning_rate": 8.72544080604534e-08, + "logits/chosen": -2.766702651977539, + "logits/rejected": -2.7301106452941895, + "logps/chosen": -262.9296875, + "logps/rejected": -208.35519409179688, + "loss": 0.6917, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.012347053736448288, + "rewards/margins": 0.004885281436145306, + "rewards/rejected": 0.007461773697286844, + "step": 2680 + }, + { + "epoch": 0.47, + "learning_rate": 8.720403022670024e-08, + "logits/chosen": -2.7742788791656494, + "logits/rejected": -2.7576308250427246, + "logps/chosen": -204.61465454101562, + "logps/rejected": -202.59237670898438, + "loss": 0.6927, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": 0.008512269705533981, + "rewards/margins": -0.0016176451463252306, + "rewards/rejected": 0.010129915550351143, + "step": 2690 + }, + { + "epoch": 0.47, + "learning_rate": 8.71536523929471e-08, + "logits/chosen": -2.7163846492767334, + "logits/rejected": -2.8089888095855713, + "logps/chosen": -248.59158325195312, + "logps/rejected": -242.52670288085938, + "loss": 0.692, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.012646988034248352, + "rewards/margins": 0.0014709432143718004, + "rewards/rejected": 0.011176046915352345, + "step": 2700 + }, + { + "epoch": 0.47, + "learning_rate": 8.710327455919396e-08, + "logits/chosen": -2.7283523082733154, + "logits/rejected": -2.709995746612549, + "logps/chosen": -247.4280242919922, + "logps/rejected": -207.9947052001953, + "loss": 0.6922, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.009775625541806221, + "rewards/margins": -0.0002165736659662798, + "rewards/rejected": 0.009992199949920177, + "step": 2710 + }, + { + "epoch": 0.48, + "learning_rate": 8.705289672544081e-08, + "logits/chosen": -2.8027420043945312, + "logits/rejected": -2.8436694145202637, + "logps/chosen": -202.6864471435547, + "logps/rejected": -221.2021026611328, + "loss": 0.6925, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.007427896372973919, + "rewards/margins": -0.0015940333250910044, + "rewards/rejected": 0.009021928533911705, + "step": 2720 + }, + { + "epoch": 0.48, + "learning_rate": 8.700251889168765e-08, + "logits/chosen": -2.680032253265381, + "logits/rejected": -2.7500858306884766, + "logps/chosen": -225.693359375, + "logps/rejected": -206.8023223876953, + "loss": 0.6926, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.00921904668211937, + "rewards/margins": 0.0021597917657345533, + "rewards/rejected": 0.007059253752231598, + "step": 2730 + }, + { + "epoch": 0.48, + "learning_rate": 8.69521410579345e-08, + "logits/chosen": -2.7341065406799316, + "logits/rejected": -2.755167245864868, + "logps/chosen": -193.05245971679688, + "logps/rejected": -170.5665740966797, + "loss": 0.6923, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.005958110094070435, + "rewards/margins": 0.0001765273918863386, + "rewards/rejected": 0.005781582556664944, + "step": 2740 + }, + { + "epoch": 0.48, + "learning_rate": 8.690176322418136e-08, + "logits/chosen": -2.7305095195770264, + "logits/rejected": -2.7078235149383545, + "logps/chosen": -233.4241485595703, + "logps/rejected": -181.7233123779297, + "loss": 0.6922, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.010703453794121742, + "rewards/margins": 0.002297390252351761, + "rewards/rejected": 0.008406064473092556, + "step": 2750 + }, + { + "epoch": 0.48, + "learning_rate": 8.685138539042821e-08, + "logits/chosen": -2.761038303375244, + "logits/rejected": -2.6922402381896973, + "logps/chosen": -191.82229614257812, + "logps/rejected": -203.77139282226562, + "loss": 0.6924, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.008268560282886028, + "rewards/margins": 6.912881508469582e-05, + "rewards/rejected": 0.00819943193346262, + "step": 2760 + }, + { + "epoch": 0.49, + "learning_rate": 8.680100755667505e-08, + "logits/chosen": -2.7586519718170166, + "logits/rejected": -2.695542097091675, + "logps/chosen": -230.31625366210938, + "logps/rejected": -218.05117797851562, + "loss": 0.6927, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.00877605751156807, + "rewards/margins": 0.0006737986695952713, + "rewards/rejected": 0.008102258667349815, + "step": 2770 + }, + { + "epoch": 0.49, + "learning_rate": 8.67506297229219e-08, + "logits/chosen": -2.7693123817443848, + "logits/rejected": -2.8033013343811035, + "logps/chosen": -268.99603271484375, + "logps/rejected": -246.95742797851562, + "loss": 0.6915, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.015248882584273815, + "rewards/margins": 0.0025188270956277847, + "rewards/rejected": 0.012730054557323456, + "step": 2780 + }, + { + "epoch": 0.49, + "learning_rate": 8.670025188916876e-08, + "logits/chosen": -2.764688014984131, + "logits/rejected": -2.758216619491577, + "logps/chosen": -206.0214080810547, + "logps/rejected": -178.74722290039062, + "loss": 0.6922, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.01020827703177929, + "rewards/margins": 0.0022834674455225468, + "rewards/rejected": 0.00792481005191803, + "step": 2790 + }, + { + "epoch": 0.49, + "learning_rate": 8.664987405541561e-08, + "logits/chosen": -2.723081350326538, + "logits/rejected": -2.7940492630004883, + "logps/chosen": -203.63230895996094, + "logps/rejected": -179.57211303710938, + "loss": 0.6918, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.00934748724102974, + "rewards/margins": 0.0031101994682103395, + "rewards/rejected": 0.0062372866086661816, + "step": 2800 + }, + { + "epoch": 0.49, + "learning_rate": 8.659949622166247e-08, + "logits/chosen": -2.743274211883545, + "logits/rejected": -2.7649941444396973, + "logps/chosen": -209.7469024658203, + "logps/rejected": -220.0643768310547, + "loss": 0.6921, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.008425967767834663, + "rewards/margins": 0.0009932437678799033, + "rewards/rejected": 0.007432723883539438, + "step": 2810 + }, + { + "epoch": 0.49, + "learning_rate": 8.654911838790932e-08, + "logits/chosen": -2.7621662616729736, + "logits/rejected": -2.7177906036376953, + "logps/chosen": -215.0526580810547, + "logps/rejected": -190.55581665039062, + "loss": 0.6922, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.010186800733208656, + "rewards/margins": 0.0018928442150354385, + "rewards/rejected": 0.008293956518173218, + "step": 2820 + }, + { + "epoch": 0.5, + "learning_rate": 8.649874055415617e-08, + "logits/chosen": -2.8004374504089355, + "logits/rejected": -2.7490596771240234, + "logps/chosen": -252.2415008544922, + "logps/rejected": -221.1431427001953, + "loss": 0.6919, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.012386414222419262, + "rewards/margins": 0.0008427410502918065, + "rewards/rejected": 0.01154367346316576, + "step": 2830 + }, + { + "epoch": 0.5, + "learning_rate": 8.644836272040303e-08, + "logits/chosen": -2.810251235961914, + "logits/rejected": -2.7899842262268066, + "logps/chosen": -239.23046875, + "logps/rejected": -231.6127471923828, + "loss": 0.6926, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.012533411383628845, + "rewards/margins": 0.0014264009660109878, + "rewards/rejected": 0.011107010766863823, + "step": 2840 + }, + { + "epoch": 0.5, + "learning_rate": 8.639798488664987e-08, + "logits/chosen": -2.784536600112915, + "logits/rejected": -2.7550041675567627, + "logps/chosen": -248.12338256835938, + "logps/rejected": -197.28073120117188, + "loss": 0.6915, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.014371541328728199, + "rewards/margins": 0.003601966891437769, + "rewards/rejected": 0.010769573971629143, + "step": 2850 + }, + { + "epoch": 0.5, + "learning_rate": 8.634760705289672e-08, + "logits/chosen": -2.8218891620635986, + "logits/rejected": -2.742927074432373, + "logps/chosen": -196.79637145996094, + "logps/rejected": -190.49765014648438, + "loss": 0.6923, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.00799397099763155, + "rewards/margins": -0.001486542634665966, + "rewards/rejected": 0.009480513632297516, + "step": 2860 + }, + { + "epoch": 0.5, + "learning_rate": 8.629722921914358e-08, + "logits/chosen": -2.766782522201538, + "logits/rejected": -2.7526514530181885, + "logps/chosen": -237.14126586914062, + "logps/rejected": -223.09487915039062, + "loss": 0.6926, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.010379480198025703, + "rewards/margins": 0.003819843288511038, + "rewards/rejected": 0.006559636443853378, + "step": 2870 + }, + { + "epoch": 0.5, + "learning_rate": 8.624685138539043e-08, + "logits/chosen": -2.694092273712158, + "logits/rejected": -2.7033393383026123, + "logps/chosen": -186.11802673339844, + "logps/rejected": -168.0809326171875, + "loss": 0.6917, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.010750077664852142, + "rewards/margins": 0.00394693948328495, + "rewards/rejected": 0.006803138647228479, + "step": 2880 + }, + { + "epoch": 0.51, + "learning_rate": 8.619647355163727e-08, + "logits/chosen": -2.7816433906555176, + "logits/rejected": -2.6702535152435303, + "logps/chosen": -207.6709747314453, + "logps/rejected": -180.0514678955078, + "loss": 0.6912, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.011553024873137474, + "rewards/margins": 0.00432405062019825, + "rewards/rejected": 0.007228974252939224, + "step": 2890 + }, + { + "epoch": 0.51, + "learning_rate": 8.614609571788412e-08, + "logits/chosen": -2.7347779273986816, + "logits/rejected": -2.7691762447357178, + "logps/chosen": -230.37808227539062, + "logps/rejected": -183.2679901123047, + "loss": 0.6913, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.009555203840136528, + "rewards/margins": 0.005391639657318592, + "rewards/rejected": 0.004163564182817936, + "step": 2900 + }, + { + "epoch": 0.51, + "learning_rate": 8.609571788413098e-08, + "logits/chosen": -2.8352231979370117, + "logits/rejected": -2.7687888145446777, + "logps/chosen": -208.2872772216797, + "logps/rejected": -177.54238891601562, + "loss": 0.6922, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.007140007801353931, + "rewards/margins": 0.00021615605510305613, + "rewards/rejected": 0.006923851557075977, + "step": 2910 + }, + { + "epoch": 0.51, + "learning_rate": 8.604534005037783e-08, + "logits/chosen": -2.801035165786743, + "logits/rejected": -2.7708606719970703, + "logps/chosen": -267.33074951171875, + "logps/rejected": -247.96484375, + "loss": 0.6919, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.012757198885083199, + "rewards/margins": 0.003161564003676176, + "rewards/rejected": 0.00959563534706831, + "step": 2920 + }, + { + "epoch": 0.51, + "learning_rate": 8.599496221662468e-08, + "logits/chosen": -2.798997163772583, + "logits/rejected": -2.7465548515319824, + "logps/chosen": -221.67544555664062, + "logps/rejected": -173.8419952392578, + "loss": 0.6921, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0111413998529315, + "rewards/margins": 0.0030490579083561897, + "rewards/rejected": 0.008092342875897884, + "step": 2930 + }, + { + "epoch": 0.51, + "learning_rate": 8.594458438287154e-08, + "logits/chosen": -2.745358943939209, + "logits/rejected": -2.7377078533172607, + "logps/chosen": -241.1657257080078, + "logps/rejected": -220.897705078125, + "loss": 0.6917, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.007529490627348423, + "rewards/margins": -6.388258043443784e-05, + "rewards/rejected": 0.00759337330237031, + "step": 2940 + }, + { + "epoch": 0.52, + "learning_rate": 8.589420654911839e-08, + "logits/chosen": -2.70111346244812, + "logits/rejected": -2.75768780708313, + "logps/chosen": -242.2528076171875, + "logps/rejected": -191.04638671875, + "loss": 0.6916, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.013275270350277424, + "rewards/margins": 0.005159012973308563, + "rewards/rejected": 0.00811625737696886, + "step": 2950 + }, + { + "epoch": 0.52, + "learning_rate": 8.584382871536524e-08, + "logits/chosen": -2.7602486610412598, + "logits/rejected": -2.752366065979004, + "logps/chosen": -266.2757263183594, + "logps/rejected": -203.05038452148438, + "loss": 0.6925, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.01176394708454609, + "rewards/margins": 0.002135035116225481, + "rewards/rejected": 0.009628912433981895, + "step": 2960 + }, + { + "epoch": 0.52, + "learning_rate": 8.579345088161209e-08, + "logits/chosen": -2.7365550994873047, + "logits/rejected": -2.801192045211792, + "logps/chosen": -237.6589813232422, + "logps/rejected": -185.87973022460938, + "loss": 0.6913, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.013516830280423164, + "rewards/margins": 0.0016924828523769975, + "rewards/rejected": 0.01182434894144535, + "step": 2970 + }, + { + "epoch": 0.52, + "learning_rate": 8.574307304785894e-08, + "logits/chosen": -2.7330987453460693, + "logits/rejected": -2.7530648708343506, + "logps/chosen": -234.9535675048828, + "logps/rejected": -240.99813842773438, + "loss": 0.6917, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.015216231346130371, + "rewards/margins": 0.004241775255650282, + "rewards/rejected": 0.010974457487463951, + "step": 2980 + }, + { + "epoch": 0.52, + "learning_rate": 8.569269521410579e-08, + "logits/chosen": -2.765040397644043, + "logits/rejected": -2.7268776893615723, + "logps/chosen": -204.8981475830078, + "logps/rejected": -212.19705200195312, + "loss": 0.6916, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.013496240600943565, + "rewards/margins": 0.0013568944996222854, + "rewards/rejected": 0.012139346450567245, + "step": 2990 + }, + { + "epoch": 0.53, + "learning_rate": 8.564231738035263e-08, + "logits/chosen": -2.8201658725738525, + "logits/rejected": -2.7453672885894775, + "logps/chosen": -232.99221801757812, + "logps/rejected": -246.0234832763672, + "loss": 0.6916, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.014087246730923653, + "rewards/margins": 0.0024903384037315845, + "rewards/rejected": 0.01159690786153078, + "step": 3000 + }, + { + "epoch": 0.53, + "learning_rate": 8.559193954659949e-08, + "logits/chosen": -2.8084664344787598, + "logits/rejected": -2.7652931213378906, + "logps/chosen": -276.5728454589844, + "logps/rejected": -220.3472900390625, + "loss": 0.6917, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.012886193580925465, + "rewards/margins": 0.0032176401000469923, + "rewards/rejected": 0.009668553248047829, + "step": 3010 + }, + { + "epoch": 0.53, + "learning_rate": 8.554156171284634e-08, + "logits/chosen": -2.7719342708587646, + "logits/rejected": -2.784611701965332, + "logps/chosen": -238.6121826171875, + "logps/rejected": -219.5137939453125, + "loss": 0.692, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.010869468562304974, + "rewards/margins": 0.0018772600451484323, + "rewards/rejected": 0.00899220909923315, + "step": 3020 + }, + { + "epoch": 0.53, + "learning_rate": 8.54911838790932e-08, + "logits/chosen": -2.8003268241882324, + "logits/rejected": -2.795473098754883, + "logps/chosen": -229.3064422607422, + "logps/rejected": -202.93734741210938, + "loss": 0.6921, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.011820869520306587, + "rewards/margins": 0.003250813577324152, + "rewards/rejected": 0.008570056408643723, + "step": 3030 + }, + { + "epoch": 0.53, + "learning_rate": 8.544080604534005e-08, + "logits/chosen": -2.7847442626953125, + "logits/rejected": -2.734316349029541, + "logps/chosen": -201.69662475585938, + "logps/rejected": -186.3741455078125, + "loss": 0.6918, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.010374282486736774, + "rewards/margins": 0.0019776958506554365, + "rewards/rejected": 0.008396586403250694, + "step": 3040 + }, + { + "epoch": 0.53, + "learning_rate": 8.53904282115869e-08, + "logits/chosen": -2.7927279472351074, + "logits/rejected": -2.799988269805908, + "logps/chosen": -238.63778686523438, + "logps/rejected": -213.6460723876953, + "loss": 0.692, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.015687134116888046, + "rewards/margins": 0.0027517948765307665, + "rewards/rejected": 0.012935337610542774, + "step": 3050 + }, + { + "epoch": 0.54, + "learning_rate": 8.534005037783375e-08, + "logits/chosen": -2.6211276054382324, + "logits/rejected": -2.582188606262207, + "logps/chosen": -215.00106811523438, + "logps/rejected": -182.13609313964844, + "loss": 0.6923, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.011294371448457241, + "rewards/margins": 0.001207565190270543, + "rewards/rejected": 0.010086806491017342, + "step": 3060 + }, + { + "epoch": 0.54, + "learning_rate": 8.528967254408061e-08, + "logits/chosen": -2.757004737854004, + "logits/rejected": -2.819514036178589, + "logps/chosen": -221.3273162841797, + "logps/rejected": -190.31556701660156, + "loss": 0.6921, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.011431792750954628, + "rewards/margins": 0.001231744303368032, + "rewards/rejected": 0.010200048796832561, + "step": 3070 + }, + { + "epoch": 0.54, + "learning_rate": 8.523929471032745e-08, + "logits/chosen": -2.7367422580718994, + "logits/rejected": -2.7337427139282227, + "logps/chosen": -263.4180603027344, + "logps/rejected": -230.3423309326172, + "loss": 0.6916, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.015658225864171982, + "rewards/margins": 0.0033743069507181644, + "rewards/rejected": 0.012283921241760254, + "step": 3080 + }, + { + "epoch": 0.54, + "learning_rate": 8.51889168765743e-08, + "logits/chosen": -2.800112247467041, + "logits/rejected": -2.7367866039276123, + "logps/chosen": -218.00650024414062, + "logps/rejected": -169.1083526611328, + "loss": 0.6923, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.012381301261484623, + "rewards/margins": 0.005484296940267086, + "rewards/rejected": 0.006897004786878824, + "step": 3090 + }, + { + "epoch": 0.54, + "learning_rate": 8.513853904282116e-08, + "logits/chosen": -2.7532482147216797, + "logits/rejected": -2.7856948375701904, + "logps/chosen": -257.03302001953125, + "logps/rejected": -208.6194305419922, + "loss": 0.6925, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.014161042869091034, + "rewards/margins": 0.002776671200990677, + "rewards/rejected": 0.011384371668100357, + "step": 3100 + }, + { + "epoch": 0.54, + "learning_rate": 8.508816120906801e-08, + "logits/chosen": -2.7750141620635986, + "logits/rejected": -2.7644925117492676, + "logps/chosen": -237.3404541015625, + "logps/rejected": -179.40928649902344, + "loss": 0.692, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.010464548133313656, + "rewards/margins": -0.0005554911913350224, + "rewards/rejected": 0.011020039208233356, + "step": 3110 + }, + { + "epoch": 0.55, + "learning_rate": 8.503778337531485e-08, + "logits/chosen": -2.740729808807373, + "logits/rejected": -2.842524766921997, + "logps/chosen": -237.0664520263672, + "logps/rejected": -211.84603881835938, + "loss": 0.6909, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.011694247834384441, + "rewards/margins": -0.0019409225787967443, + "rewards/rejected": 0.01363517064601183, + "step": 3120 + }, + { + "epoch": 0.55, + "learning_rate": 8.49874055415617e-08, + "logits/chosen": -2.7111763954162598, + "logits/rejected": -2.7561068534851074, + "logps/chosen": -263.2214660644531, + "logps/rejected": -206.15432739257812, + "loss": 0.6909, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.013094994239509106, + "rewards/margins": 0.0035277139395475388, + "rewards/rejected": 0.009567281231284142, + "step": 3130 + }, + { + "epoch": 0.55, + "learning_rate": 8.493702770780856e-08, + "logits/chosen": -2.720445394515991, + "logits/rejected": -2.7390005588531494, + "logps/chosen": -226.5557098388672, + "logps/rejected": -216.19784545898438, + "loss": 0.6922, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.012567183002829552, + "rewards/margins": 0.0029570916667580605, + "rewards/rejected": 0.009610090404748917, + "step": 3140 + }, + { + "epoch": 0.55, + "learning_rate": 8.488664987405541e-08, + "logits/chosen": -2.736865758895874, + "logits/rejected": -2.7989611625671387, + "logps/chosen": -270.09747314453125, + "logps/rejected": -230.9444122314453, + "loss": 0.6917, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.014618085697293282, + "rewards/margins": 0.003351908642798662, + "rewards/rejected": 0.011266176588833332, + "step": 3150 + }, + { + "epoch": 0.55, + "learning_rate": 8.483627204030226e-08, + "logits/chosen": -2.685662031173706, + "logits/rejected": -2.750356912612915, + "logps/chosen": -271.740234375, + "logps/rejected": -247.66781616210938, + "loss": 0.6918, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.01378130353987217, + "rewards/margins": 0.0003704793634824455, + "rewards/rejected": 0.013410824351012707, + "step": 3160 + }, + { + "epoch": 0.56, + "learning_rate": 8.478589420654912e-08, + "logits/chosen": -2.7123258113861084, + "logits/rejected": -2.8179118633270264, + "logps/chosen": -233.6159210205078, + "logps/rejected": -223.5303955078125, + "loss": 0.6915, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.014396825805306435, + "rewards/margins": 0.003176445607095957, + "rewards/rejected": 0.01122037973254919, + "step": 3170 + }, + { + "epoch": 0.56, + "learning_rate": 8.473551637279597e-08, + "logits/chosen": -2.7784855365753174, + "logits/rejected": -2.7305197715759277, + "logps/chosen": -258.8409118652344, + "logps/rejected": -214.46981811523438, + "loss": 0.6914, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.01418989896774292, + "rewards/margins": 0.0008127937326207757, + "rewards/rejected": 0.013377104885876179, + "step": 3180 + }, + { + "epoch": 0.56, + "learning_rate": 8.468513853904283e-08, + "logits/chosen": -2.7307345867156982, + "logits/rejected": -2.750396251678467, + "logps/chosen": -214.94189453125, + "logps/rejected": -179.4948272705078, + "loss": 0.6911, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.012370200827717781, + "rewards/margins": 0.0020483885891735554, + "rewards/rejected": 0.010321812704205513, + "step": 3190 + }, + { + "epoch": 0.56, + "learning_rate": 8.463476070528967e-08, + "logits/chosen": -2.716055154800415, + "logits/rejected": -2.805588722229004, + "logps/chosen": -236.4894256591797, + "logps/rejected": -175.95303344726562, + "loss": 0.6919, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.012703245505690575, + "rewards/margins": 0.0037045180797576904, + "rewards/rejected": 0.008998729288578033, + "step": 3200 + }, + { + "epoch": 0.56, + "learning_rate": 8.458438287153652e-08, + "logits/chosen": -2.7577478885650635, + "logits/rejected": -2.724205493927002, + "logps/chosen": -223.320556640625, + "logps/rejected": -222.6649932861328, + "loss": 0.6917, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.010703946463763714, + "rewards/margins": 0.0017586011672392488, + "rewards/rejected": 0.0089453449472785, + "step": 3210 + }, + { + "epoch": 0.56, + "learning_rate": 8.453400503778337e-08, + "logits/chosen": -2.7715744972229004, + "logits/rejected": -2.7677001953125, + "logps/chosen": -298.09503173828125, + "logps/rejected": -261.20379638671875, + "loss": 0.692, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.01782422699034214, + "rewards/margins": 0.004209473729133606, + "rewards/rejected": 0.013614753261208534, + "step": 3220 + }, + { + "epoch": 0.57, + "learning_rate": 8.448362720403023e-08, + "logits/chosen": -2.7621097564697266, + "logits/rejected": -2.7440028190612793, + "logps/chosen": -214.5993194580078, + "logps/rejected": -223.1764678955078, + "loss": 0.6918, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.011158348992466927, + "rewards/margins": 0.004007419571280479, + "rewards/rejected": 0.007150929421186447, + "step": 3230 + }, + { + "epoch": 0.57, + "learning_rate": 8.443324937027707e-08, + "logits/chosen": -2.788442611694336, + "logits/rejected": -2.7765183448791504, + "logps/chosen": -225.32937622070312, + "logps/rejected": -209.044677734375, + "loss": 0.6916, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.014530852437019348, + "rewards/margins": 0.00227823993191123, + "rewards/rejected": 0.01225261203944683, + "step": 3240 + }, + { + "epoch": 0.57, + "learning_rate": 8.438287153652392e-08, + "logits/chosen": -2.7100307941436768, + "logits/rejected": -2.7646098136901855, + "logps/chosen": -236.94656372070312, + "logps/rejected": -199.8778533935547, + "loss": 0.6908, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.01314136665314436, + "rewards/margins": 0.004657679237425327, + "rewards/rejected": 0.008483686484396458, + "step": 3250 + }, + { + "epoch": 0.57, + "learning_rate": 8.433249370277077e-08, + "logits/chosen": -2.819563865661621, + "logits/rejected": -2.7609450817108154, + "logps/chosen": -253.8069305419922, + "logps/rejected": -241.51123046875, + "loss": 0.6923, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.012674269266426563, + "rewards/margins": 0.0009184217196889222, + "rewards/rejected": 0.011755848303437233, + "step": 3260 + }, + { + "epoch": 0.57, + "learning_rate": 8.428211586901763e-08, + "logits/chosen": -2.685859203338623, + "logits/rejected": -2.7351815700531006, + "logps/chosen": -227.080810546875, + "logps/rejected": -203.94802856445312, + "loss": 0.6917, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.014903845265507698, + "rewards/margins": 0.0018497860291972756, + "rewards/rejected": 0.013054059818387032, + "step": 3270 + }, + { + "epoch": 0.57, + "learning_rate": 8.423173803526448e-08, + "logits/chosen": -2.7697246074676514, + "logits/rejected": -2.8137755393981934, + "logps/chosen": -251.1637725830078, + "logps/rejected": -195.75613403320312, + "loss": 0.6918, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.012458008714020252, + "rewards/margins": 0.004305009264498949, + "rewards/rejected": 0.008152998983860016, + "step": 3280 + }, + { + "epoch": 0.58, + "learning_rate": 8.418136020151134e-08, + "logits/chosen": -2.773317813873291, + "logits/rejected": -2.779855489730835, + "logps/chosen": -223.1930389404297, + "logps/rejected": -198.455322265625, + "loss": 0.6925, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.011802679859101772, + "rewards/margins": 0.0005634138360619545, + "rewards/rejected": 0.011239266023039818, + "step": 3290 + }, + { + "epoch": 0.58, + "learning_rate": 8.413098236775819e-08, + "logits/chosen": -2.7221474647521973, + "logits/rejected": -2.702664375305176, + "logps/chosen": -274.08392333984375, + "logps/rejected": -247.7399444580078, + "loss": 0.6915, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.019806358963251114, + "rewards/margins": 0.0065388367511332035, + "rewards/rejected": 0.013267521746456623, + "step": 3300 + }, + { + "epoch": 0.58, + "learning_rate": 8.408060453400503e-08, + "logits/chosen": -2.8209447860717773, + "logits/rejected": -2.834242582321167, + "logps/chosen": -247.25802612304688, + "logps/rejected": -201.07403564453125, + "loss": 0.692, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.016469743102788925, + "rewards/margins": 0.004864540882408619, + "rewards/rejected": 0.011605201289057732, + "step": 3310 + }, + { + "epoch": 0.58, + "learning_rate": 8.403022670025188e-08, + "logits/chosen": -2.7461419105529785, + "logits/rejected": -2.732264280319214, + "logps/chosen": -227.6762237548828, + "logps/rejected": -209.2851104736328, + "loss": 0.691, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.012286007404327393, + "rewards/margins": 0.0037416242994368076, + "rewards/rejected": 0.008544383570551872, + "step": 3320 + }, + { + "epoch": 0.58, + "learning_rate": 8.397984886649874e-08, + "logits/chosen": -2.713840961456299, + "logits/rejected": -2.692565441131592, + "logps/chosen": -228.81851196289062, + "logps/rejected": -199.67190551757812, + "loss": 0.6916, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.017076753079891205, + "rewards/margins": 0.006653298623859882, + "rewards/rejected": 0.010423455387353897, + "step": 3330 + }, + { + "epoch": 0.59, + "learning_rate": 8.392947103274559e-08, + "logits/chosen": -2.811196804046631, + "logits/rejected": -2.7759921550750732, + "logps/chosen": -237.18215942382812, + "logps/rejected": -184.60023498535156, + "loss": 0.6912, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.015599017962813377, + "rewards/margins": 0.004597905091941357, + "rewards/rejected": 0.011001111008226871, + "step": 3340 + }, + { + "epoch": 0.59, + "learning_rate": 8.387909319899243e-08, + "logits/chosen": -2.712432861328125, + "logits/rejected": -2.8248891830444336, + "logps/chosen": -284.87091064453125, + "logps/rejected": -221.70162963867188, + "loss": 0.6911, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.015140047296881676, + "rewards/margins": -0.00015327543951570988, + "rewards/rejected": 0.015293324366211891, + "step": 3350 + }, + { + "epoch": 0.59, + "learning_rate": 8.382871536523928e-08, + "logits/chosen": -2.778764009475708, + "logits/rejected": -2.8072402477264404, + "logps/chosen": -249.6968536376953, + "logps/rejected": -218.6016082763672, + "loss": 0.6911, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.01566213183104992, + "rewards/margins": 0.0012918005231767893, + "rewards/rejected": 0.014370331540703773, + "step": 3360 + }, + { + "epoch": 0.59, + "learning_rate": 8.377833753148614e-08, + "logits/chosen": -2.770099639892578, + "logits/rejected": -2.793405771255493, + "logps/chosen": -242.748291015625, + "logps/rejected": -207.92636108398438, + "loss": 0.6917, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0115726999938488, + "rewards/margins": 0.004362519830465317, + "rewards/rejected": 0.0072101810947060585, + "step": 3370 + }, + { + "epoch": 0.59, + "learning_rate": 8.372795969773299e-08, + "logits/chosen": -2.7587761878967285, + "logits/rejected": -2.8187568187713623, + "logps/chosen": -288.847412109375, + "logps/rejected": -241.4041290283203, + "loss": 0.6924, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.019069483503699303, + "rewards/margins": 0.003561516525223851, + "rewards/rejected": 0.01550796814262867, + "step": 3380 + }, + { + "epoch": 0.59, + "learning_rate": 8.367758186397985e-08, + "logits/chosen": -2.773113489151001, + "logits/rejected": -2.843980312347412, + "logps/chosen": -235.67578125, + "logps/rejected": -217.6513214111328, + "loss": 0.6924, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.011275621131062508, + "rewards/margins": -0.0001427721290383488, + "rewards/rejected": 0.01141839288175106, + "step": 3390 + }, + { + "epoch": 0.6, + "learning_rate": 8.36272040302267e-08, + "logits/chosen": -2.858863115310669, + "logits/rejected": -2.758176326751709, + "logps/chosen": -248.9114227294922, + "logps/rejected": -233.37063598632812, + "loss": 0.6912, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.019003715366125107, + "rewards/margins": 0.0045727817341685295, + "rewards/rejected": 0.014430937357246876, + "step": 3400 + }, + { + "epoch": 0.6, + "learning_rate": 8.357682619647355e-08, + "logits/chosen": -2.7978243827819824, + "logits/rejected": -2.765048027038574, + "logps/chosen": -215.2990264892578, + "logps/rejected": -195.3312225341797, + "loss": 0.692, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.012433426454663277, + "rewards/margins": 0.0025961692444980145, + "rewards/rejected": 0.009837256744503975, + "step": 3410 + }, + { + "epoch": 0.6, + "learning_rate": 8.35264483627204e-08, + "logits/chosen": -2.8078112602233887, + "logits/rejected": -2.7712979316711426, + "logps/chosen": -225.05715942382812, + "logps/rejected": -191.1551971435547, + "loss": 0.6917, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.011315623298287392, + "rewards/margins": 0.004302586428821087, + "rewards/rejected": 0.007013037800788879, + "step": 3420 + }, + { + "epoch": 0.6, + "learning_rate": 8.347607052896725e-08, + "logits/chosen": -2.701322078704834, + "logits/rejected": -2.6965625286102295, + "logps/chosen": -190.59228515625, + "logps/rejected": -183.9395294189453, + "loss": 0.6921, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.013294106349349022, + "rewards/margins": 0.0023096068762242794, + "rewards/rejected": 0.01098449993878603, + "step": 3430 + }, + { + "epoch": 0.6, + "learning_rate": 8.34256926952141e-08, + "logits/chosen": -2.743400812149048, + "logits/rejected": -2.7452921867370605, + "logps/chosen": -258.9476318359375, + "logps/rejected": -218.33700561523438, + "loss": 0.6913, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.014264727011322975, + "rewards/margins": 0.0023330049589276314, + "rewards/rejected": 0.011931722052395344, + "step": 3440 + }, + { + "epoch": 0.6, + "learning_rate": 8.337531486146095e-08, + "logits/chosen": -2.759187698364258, + "logits/rejected": -2.7136118412017822, + "logps/chosen": -221.3391876220703, + "logps/rejected": -180.05746459960938, + "loss": 0.692, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.013907767832279205, + "rewards/margins": 0.004912000615149736, + "rewards/rejected": 0.008995766751468182, + "step": 3450 + }, + { + "epoch": 0.61, + "learning_rate": 8.332493702770781e-08, + "logits/chosen": -2.671977996826172, + "logits/rejected": -2.743464946746826, + "logps/chosen": -240.4029083251953, + "logps/rejected": -222.5838623046875, + "loss": 0.6921, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.011776207946240902, + "rewards/margins": 0.0016693586949259043, + "rewards/rejected": 0.010106848552823067, + "step": 3460 + }, + { + "epoch": 0.61, + "learning_rate": 8.327455919395465e-08, + "logits/chosen": -2.760468006134033, + "logits/rejected": -2.7636971473693848, + "logps/chosen": -210.5015106201172, + "logps/rejected": -191.4309539794922, + "loss": 0.6913, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.012788991443812847, + "rewards/margins": 0.0014230671804398298, + "rewards/rejected": 0.011365924030542374, + "step": 3470 + }, + { + "epoch": 0.61, + "learning_rate": 8.32241813602015e-08, + "logits/chosen": -2.7345573902130127, + "logits/rejected": -2.7453200817108154, + "logps/chosen": -260.7548828125, + "logps/rejected": -212.4744110107422, + "loss": 0.6919, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.016130229458212852, + "rewards/margins": 0.0023641791194677353, + "rewards/rejected": 0.013766050338745117, + "step": 3480 + }, + { + "epoch": 0.61, + "learning_rate": 8.317380352644836e-08, + "logits/chosen": -2.7350945472717285, + "logits/rejected": -2.7537972927093506, + "logps/chosen": -261.77496337890625, + "logps/rejected": -223.4450225830078, + "loss": 0.6917, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.016082722693681717, + "rewards/margins": 0.0003509976086206734, + "rewards/rejected": 0.015731725841760635, + "step": 3490 + }, + { + "epoch": 0.61, + "learning_rate": 8.312342569269521e-08, + "logits/chosen": -2.717952013015747, + "logits/rejected": -2.6623072624206543, + "logps/chosen": -249.53726196289062, + "logps/rejected": -235.1985321044922, + "loss": 0.692, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.016532665118575096, + "rewards/margins": 0.003554257797077298, + "rewards/rejected": 0.012978407554328442, + "step": 3500 + }, + { + "epoch": 0.61, + "learning_rate": 8.307304785894206e-08, + "logits/chosen": -2.788193702697754, + "logits/rejected": -2.796319007873535, + "logps/chosen": -226.8190155029297, + "logps/rejected": -194.38963317871094, + "loss": 0.6909, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.016295744106173515, + "rewards/margins": 0.00471791485324502, + "rewards/rejected": 0.011577830649912357, + "step": 3510 + }, + { + "epoch": 0.62, + "learning_rate": 8.302267002518892e-08, + "logits/chosen": -2.719542980194092, + "logits/rejected": -2.699769973754883, + "logps/chosen": -219.9004669189453, + "logps/rejected": -181.20230102539062, + "loss": 0.6921, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.010805217549204826, + "rewards/margins": 0.002578904153779149, + "rewards/rejected": 0.008226314559578896, + "step": 3520 + }, + { + "epoch": 0.62, + "learning_rate": 8.297229219143577e-08, + "logits/chosen": -2.7711305618286133, + "logits/rejected": -2.761723756790161, + "logps/chosen": -265.3699951171875, + "logps/rejected": -235.4482421875, + "loss": 0.6915, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.015871699899435043, + "rewards/margins": 0.0017049426678568125, + "rewards/rejected": 0.014166759327054024, + "step": 3530 + }, + { + "epoch": 0.62, + "learning_rate": 8.292191435768262e-08, + "logits/chosen": -2.7074053287506104, + "logits/rejected": -2.709003210067749, + "logps/chosen": -230.49472045898438, + "logps/rejected": -194.09027099609375, + "loss": 0.691, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.01634136773645878, + "rewards/margins": 0.006125512532889843, + "rewards/rejected": 0.01021585427224636, + "step": 3540 + }, + { + "epoch": 0.62, + "learning_rate": 8.287153652392946e-08, + "logits/chosen": -2.709663152694702, + "logits/rejected": -2.7229886054992676, + "logps/chosen": -214.0351104736328, + "logps/rejected": -223.4528350830078, + "loss": 0.6913, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": 0.01229914091527462, + "rewards/margins": -0.001658583409152925, + "rewards/rejected": 0.013957725837826729, + "step": 3550 + }, + { + "epoch": 0.62, + "learning_rate": 8.282115869017632e-08, + "logits/chosen": -2.6734941005706787, + "logits/rejected": -2.6738343238830566, + "logps/chosen": -186.98057556152344, + "logps/rejected": -172.816650390625, + "loss": 0.6913, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.00906095840036869, + "rewards/margins": 0.0004602237604558468, + "rewards/rejected": 0.008600736036896706, + "step": 3560 + }, + { + "epoch": 0.63, + "learning_rate": 8.277078085642317e-08, + "logits/chosen": -2.7180447578430176, + "logits/rejected": -2.687653064727783, + "logps/chosen": -180.7360382080078, + "logps/rejected": -178.57864379882812, + "loss": 0.6921, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.007827245630323887, + "rewards/margins": -0.0009862823644652963, + "rewards/rejected": 0.008813528344035149, + "step": 3570 + }, + { + "epoch": 0.63, + "learning_rate": 8.272040302267002e-08, + "logits/chosen": -2.7027173042297363, + "logits/rejected": -2.6870369911193848, + "logps/chosen": -208.6110382080078, + "logps/rejected": -167.7442626953125, + "loss": 0.692, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.01145018357783556, + "rewards/margins": 0.0035087857395410538, + "rewards/rejected": 0.007941396906971931, + "step": 3580 + }, + { + "epoch": 0.63, + "learning_rate": 8.267002518891686e-08, + "logits/chosen": -2.7568917274475098, + "logits/rejected": -2.6639156341552734, + "logps/chosen": -226.4164276123047, + "logps/rejected": -186.1335906982422, + "loss": 0.6917, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.013830587267875671, + "rewards/margins": 0.0034837317653000355, + "rewards/rejected": 0.010346856899559498, + "step": 3590 + }, + { + "epoch": 0.63, + "learning_rate": 8.261964735516372e-08, + "logits/chosen": -2.8411202430725098, + "logits/rejected": -2.8351664543151855, + "logps/chosen": -207.5603790283203, + "logps/rejected": -206.82534790039062, + "loss": 0.6918, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.012709485366940498, + "rewards/margins": -0.0002613008546177298, + "rewards/rejected": 0.012970787473022938, + "step": 3600 + }, + { + "epoch": 0.63, + "learning_rate": 8.256926952141057e-08, + "logits/chosen": -2.85115909576416, + "logits/rejected": -2.836247682571411, + "logps/chosen": -217.4815673828125, + "logps/rejected": -217.00668334960938, + "loss": 0.6919, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.015054309740662575, + "rewards/margins": 0.001863854588009417, + "rewards/rejected": 0.013190452940762043, + "step": 3610 + }, + { + "epoch": 0.63, + "learning_rate": 8.251889168765743e-08, + "logits/chosen": -2.74369740486145, + "logits/rejected": -2.7580039501190186, + "logps/chosen": -280.5350341796875, + "logps/rejected": -250.761962890625, + "loss": 0.692, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02001040428876877, + "rewards/margins": 0.003991215955466032, + "rewards/rejected": 0.01601918786764145, + "step": 3620 + }, + { + "epoch": 0.64, + "learning_rate": 8.246851385390428e-08, + "logits/chosen": -2.7671589851379395, + "logits/rejected": -2.7030556201934814, + "logps/chosen": -226.4773712158203, + "logps/rejected": -183.44740295410156, + "loss": 0.6919, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.014777980744838715, + "rewards/margins": 0.006304244510829449, + "rewards/rejected": 0.008473738096654415, + "step": 3630 + }, + { + "epoch": 0.64, + "learning_rate": 8.241813602015113e-08, + "logits/chosen": -2.7083332538604736, + "logits/rejected": -2.695016860961914, + "logps/chosen": -215.36013793945312, + "logps/rejected": -189.6326904296875, + "loss": 0.6912, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.013701984658837318, + "rewards/margins": 0.0003051554667763412, + "rewards/rejected": 0.01339682936668396, + "step": 3640 + }, + { + "epoch": 0.64, + "learning_rate": 8.236775818639799e-08, + "logits/chosen": -2.798619270324707, + "logits/rejected": -2.793792247772217, + "logps/chosen": -232.0058135986328, + "logps/rejected": -157.7205810546875, + "loss": 0.691, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.01850191317498684, + "rewards/margins": 0.0096164895221591, + "rewards/rejected": 0.008885422721505165, + "step": 3650 + }, + { + "epoch": 0.64, + "learning_rate": 8.231738035264483e-08, + "logits/chosen": -2.7713623046875, + "logits/rejected": -2.6689579486846924, + "logps/chosen": -201.49600219726562, + "logps/rejected": -234.8392333984375, + "loss": 0.692, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.012621419504284859, + "rewards/margins": -0.00029890690348111093, + "rewards/rejected": 0.012920325621962547, + "step": 3660 + }, + { + "epoch": 0.64, + "learning_rate": 8.226700251889168e-08, + "logits/chosen": -2.767369508743286, + "logits/rejected": -2.744903326034546, + "logps/chosen": -206.9405059814453, + "logps/rejected": -207.5795440673828, + "loss": 0.6919, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.011534372344613075, + "rewards/margins": -0.0018367780139669776, + "rewards/rejected": 0.013371150009334087, + "step": 3670 + }, + { + "epoch": 0.64, + "learning_rate": 8.221662468513853e-08, + "logits/chosen": -2.7466063499450684, + "logits/rejected": -2.765381097793579, + "logps/chosen": -222.0699462890625, + "logps/rejected": -205.1193084716797, + "loss": 0.6914, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.012425544671714306, + "rewards/margins": -0.00028726962045766413, + "rewards/rejected": 0.012712815776467323, + "step": 3680 + }, + { + "epoch": 0.65, + "learning_rate": 8.216624685138539e-08, + "logits/chosen": -2.7388596534729004, + "logits/rejected": -2.7755088806152344, + "logps/chosen": -275.1582336425781, + "logps/rejected": -225.3055419921875, + "loss": 0.6914, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": 0.025951793417334557, + "rewards/margins": 0.010948443785309792, + "rewards/rejected": 0.015003351494669914, + "step": 3690 + }, + { + "epoch": 0.65, + "learning_rate": 8.211586901763223e-08, + "logits/chosen": -2.7461769580841064, + "logits/rejected": -2.708989143371582, + "logps/chosen": -228.46145629882812, + "logps/rejected": -185.53692626953125, + "loss": 0.6913, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.017765622586011887, + "rewards/margins": 0.00780740100890398, + "rewards/rejected": 0.009958220645785332, + "step": 3700 + }, + { + "epoch": 0.65, + "learning_rate": 8.206549118387908e-08, + "logits/chosen": -2.733278751373291, + "logits/rejected": -2.7251486778259277, + "logps/chosen": -260.572509765625, + "logps/rejected": -225.13363647460938, + "loss": 0.6911, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.019569676369428635, + "rewards/margins": 0.005702861584722996, + "rewards/rejected": 0.013866816647350788, + "step": 3710 + }, + { + "epoch": 0.65, + "learning_rate": 8.201511335012594e-08, + "logits/chosen": -2.6957457065582275, + "logits/rejected": -2.7972590923309326, + "logps/chosen": -267.50677490234375, + "logps/rejected": -215.5604705810547, + "loss": 0.6915, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.020175551995635033, + "rewards/margins": 0.005252575036138296, + "rewards/rejected": 0.01492297649383545, + "step": 3720 + }, + { + "epoch": 0.65, + "learning_rate": 8.19647355163728e-08, + "logits/chosen": -2.713207960128784, + "logits/rejected": -2.72871994972229, + "logps/chosen": -233.4993896484375, + "logps/rejected": -204.14529418945312, + "loss": 0.6929, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.014108104631304741, + "rewards/margins": -0.003692076075822115, + "rewards/rejected": 0.01780017837882042, + "step": 3730 + }, + { + "epoch": 0.66, + "learning_rate": 8.191435768261964e-08, + "logits/chosen": -2.748497247695923, + "logits/rejected": -2.683332681655884, + "logps/chosen": -240.52297973632812, + "logps/rejected": -233.1362762451172, + "loss": 0.6911, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.016229938715696335, + "rewards/margins": 0.0006633886368945241, + "rewards/rejected": 0.015566547401249409, + "step": 3740 + }, + { + "epoch": 0.66, + "learning_rate": 8.18639798488665e-08, + "logits/chosen": -2.7239058017730713, + "logits/rejected": -2.740793228149414, + "logps/chosen": -247.53268432617188, + "logps/rejected": -272.5812683105469, + "loss": 0.6916, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0161224864423275, + "rewards/margins": 0.0009723890689201653, + "rewards/rejected": 0.015150099992752075, + "step": 3750 + }, + { + "epoch": 0.66, + "learning_rate": 8.181360201511335e-08, + "logits/chosen": -2.7831082344055176, + "logits/rejected": -2.815091609954834, + "logps/chosen": -233.9501495361328, + "logps/rejected": -208.8319854736328, + "loss": 0.6909, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.017066344618797302, + "rewards/margins": 0.0011864884290844202, + "rewards/rejected": 0.015879856422543526, + "step": 3760 + }, + { + "epoch": 0.66, + "learning_rate": 8.17632241813602e-08, + "logits/chosen": -2.7610182762145996, + "logits/rejected": -2.765444278717041, + "logps/chosen": -269.3284912109375, + "logps/rejected": -238.10537719726562, + "loss": 0.6912, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.019205298274755478, + "rewards/margins": 0.007051876280456781, + "rewards/rejected": 0.012153422459959984, + "step": 3770 + }, + { + "epoch": 0.66, + "learning_rate": 8.171284634760704e-08, + "logits/chosen": -2.7351415157318115, + "logits/rejected": -2.679765224456787, + "logps/chosen": -218.440673828125, + "logps/rejected": -192.87567138671875, + "loss": 0.6911, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.01345922239124775, + "rewards/margins": 0.004528115503489971, + "rewards/rejected": 0.008931105956435204, + "step": 3780 + }, + { + "epoch": 0.66, + "learning_rate": 8.16624685138539e-08, + "logits/chosen": -2.7771928310394287, + "logits/rejected": -2.687178134918213, + "logps/chosen": -257.64398193359375, + "logps/rejected": -194.52593994140625, + "loss": 0.691, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.01612105406820774, + "rewards/margins": 0.0037273832131177187, + "rewards/rejected": 0.012393670156598091, + "step": 3790 + }, + { + "epoch": 0.67, + "learning_rate": 8.161209068010075e-08, + "logits/chosen": -2.742800712585449, + "logits/rejected": -2.764816999435425, + "logps/chosen": -207.69876098632812, + "logps/rejected": -197.75302124023438, + "loss": 0.6926, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.015343104489147663, + "rewards/margins": 0.004005838185548782, + "rewards/rejected": 0.011337265372276306, + "step": 3800 + }, + { + "epoch": 0.67, + "learning_rate": 8.15617128463476e-08, + "logits/chosen": -2.7895233631134033, + "logits/rejected": -2.6712045669555664, + "logps/chosen": -276.7768249511719, + "logps/rejected": -248.6250457763672, + "loss": 0.6912, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.02004379592835903, + "rewards/margins": 0.006672368384897709, + "rewards/rejected": 0.013371428474783897, + "step": 3810 + }, + { + "epoch": 0.67, + "learning_rate": 8.151133501259445e-08, + "logits/chosen": -2.7735464572906494, + "logits/rejected": -2.731327533721924, + "logps/chosen": -252.3322296142578, + "logps/rejected": -193.44198608398438, + "loss": 0.6907, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.01836908422410488, + "rewards/margins": 0.005864441394805908, + "rewards/rejected": 0.012504642829298973, + "step": 3820 + }, + { + "epoch": 0.67, + "learning_rate": 8.14609571788413e-08, + "logits/chosen": -2.7429397106170654, + "logits/rejected": -2.7197344303131104, + "logps/chosen": -166.81492614746094, + "logps/rejected": -153.70217895507812, + "loss": 0.6909, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.00818006880581379, + "rewards/margins": 0.001661596237681806, + "rewards/rejected": 0.006518472917377949, + "step": 3830 + }, + { + "epoch": 0.67, + "learning_rate": 8.141057934508817e-08, + "logits/chosen": -2.663329839706421, + "logits/rejected": -2.762928009033203, + "logps/chosen": -230.36672973632812, + "logps/rejected": -208.890380859375, + "loss": 0.6908, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.019962593913078308, + "rewards/margins": 0.005378905683755875, + "rewards/rejected": 0.014583689160645008, + "step": 3840 + }, + { + "epoch": 0.67, + "learning_rate": 8.136020151133502e-08, + "logits/chosen": -2.7788891792297363, + "logits/rejected": -2.7233879566192627, + "logps/chosen": -222.71078491210938, + "logps/rejected": -188.53250122070312, + "loss": 0.6908, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.018942857161164284, + "rewards/margins": 0.004116528667509556, + "rewards/rejected": 0.014826327562332153, + "step": 3850 + }, + { + "epoch": 0.68, + "learning_rate": 8.130982367758186e-08, + "logits/chosen": -2.789405107498169, + "logits/rejected": -2.8390228748321533, + "logps/chosen": -235.29867553710938, + "logps/rejected": -248.5530548095703, + "loss": 0.6918, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.01704949513077736, + "rewards/margins": -0.0013193708145990968, + "rewards/rejected": 0.01836886629462242, + "step": 3860 + }, + { + "epoch": 0.68, + "learning_rate": 8.125944584382871e-08, + "logits/chosen": -2.72065806388855, + "logits/rejected": -2.7855780124664307, + "logps/chosen": -223.49081420898438, + "logps/rejected": -193.26185607910156, + "loss": 0.6912, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.013743147253990173, + "rewards/margins": 0.0023424732498824596, + "rewards/rejected": 0.011400674469769001, + "step": 3870 + }, + { + "epoch": 0.68, + "learning_rate": 8.120906801007557e-08, + "logits/chosen": -2.7632253170013428, + "logits/rejected": -2.6923036575317383, + "logps/chosen": -215.9404754638672, + "logps/rejected": -166.86044311523438, + "loss": 0.6916, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.017654119059443474, + "rewards/margins": 0.005568289663642645, + "rewards/rejected": 0.01208583079278469, + "step": 3880 + }, + { + "epoch": 0.68, + "learning_rate": 8.115869017632242e-08, + "logits/chosen": -2.7535698413848877, + "logits/rejected": -2.740983724594116, + "logps/chosen": -188.03590393066406, + "logps/rejected": -160.87303161621094, + "loss": 0.6924, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.01075964979827404, + "rewards/margins": 0.0006056831916794181, + "rewards/rejected": 0.010153967887163162, + "step": 3890 + }, + { + "epoch": 0.68, + "learning_rate": 8.110831234256926e-08, + "logits/chosen": -2.7618038654327393, + "logits/rejected": -2.7280309200286865, + "logps/chosen": -224.43685913085938, + "logps/rejected": -183.01840209960938, + "loss": 0.6905, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.015426975674927235, + "rewards/margins": 0.005461042746901512, + "rewards/rejected": 0.009965931996703148, + "step": 3900 + }, + { + "epoch": 0.68, + "learning_rate": 8.105793450881612e-08, + "logits/chosen": -2.7761223316192627, + "logits/rejected": -2.716975450515747, + "logps/chosen": -215.36886596679688, + "logps/rejected": -202.84988403320312, + "loss": 0.691, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.016212482005357742, + "rewards/margins": 0.0005874786293134093, + "rewards/rejected": 0.0156250037252903, + "step": 3910 + }, + { + "epoch": 0.69, + "learning_rate": 8.100755667506297e-08, + "logits/chosen": -2.7833571434020996, + "logits/rejected": -2.876706838607788, + "logps/chosen": -259.8275451660156, + "logps/rejected": -235.8184051513672, + "loss": 0.6914, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.01803353801369667, + "rewards/margins": -0.0025308975018560886, + "rewards/rejected": 0.020564435049891472, + "step": 3920 + }, + { + "epoch": 0.69, + "learning_rate": 8.095717884130982e-08, + "logits/chosen": -2.835965156555176, + "logits/rejected": -2.7779338359832764, + "logps/chosen": -225.6724853515625, + "logps/rejected": -188.37217712402344, + "loss": 0.6919, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.01582942344248295, + "rewards/margins": 0.0034069358371198177, + "rewards/rejected": 0.012422487139701843, + "step": 3930 + }, + { + "epoch": 0.69, + "learning_rate": 8.090680100755666e-08, + "logits/chosen": -2.8340446949005127, + "logits/rejected": -2.8134090900421143, + "logps/chosen": -212.24960327148438, + "logps/rejected": -182.80239868164062, + "loss": 0.6913, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.015874182805418968, + "rewards/margins": 0.004976223688572645, + "rewards/rejected": 0.01089795958250761, + "step": 3940 + }, + { + "epoch": 0.69, + "learning_rate": 8.085642317380352e-08, + "logits/chosen": -2.7107186317443848, + "logits/rejected": -2.705901622772217, + "logps/chosen": -207.7930450439453, + "logps/rejected": -200.37973022460938, + "loss": 0.691, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.01649567112326622, + "rewards/margins": 0.0022905156947672367, + "rewards/rejected": 0.014205153100192547, + "step": 3950 + }, + { + "epoch": 0.69, + "learning_rate": 8.080604534005038e-08, + "logits/chosen": -2.7393903732299805, + "logits/rejected": -2.8167338371276855, + "logps/chosen": -239.1031951904297, + "logps/rejected": -190.6559295654297, + "loss": 0.6915, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.020263103768229485, + "rewards/margins": 0.009479226544499397, + "rewards/rejected": 0.010783876292407513, + "step": 3960 + }, + { + "epoch": 0.7, + "learning_rate": 8.075566750629722e-08, + "logits/chosen": -2.751710891723633, + "logits/rejected": -2.804835796356201, + "logps/chosen": -216.37417602539062, + "logps/rejected": -194.0995330810547, + "loss": 0.6913, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.01658977009356022, + "rewards/margins": 0.00448748329654336, + "rewards/rejected": 0.012102288194000721, + "step": 3970 + }, + { + "epoch": 0.7, + "learning_rate": 8.070528967254408e-08, + "logits/chosen": -2.7608554363250732, + "logits/rejected": -2.8055953979492188, + "logps/chosen": -191.1044158935547, + "logps/rejected": -156.22952270507812, + "loss": 0.6924, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.01224413700401783, + "rewards/margins": 0.0022321634460240602, + "rewards/rejected": 0.010011972859501839, + "step": 3980 + }, + { + "epoch": 0.7, + "learning_rate": 8.065491183879093e-08, + "logits/chosen": -2.8037281036376953, + "logits/rejected": -2.816038131713867, + "logps/chosen": -234.3374481201172, + "logps/rejected": -193.92330932617188, + "loss": 0.6919, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.01975713111460209, + "rewards/margins": 0.006761783268302679, + "rewards/rejected": 0.012995347380638123, + "step": 3990 + }, + { + "epoch": 0.7, + "learning_rate": 8.060453400503778e-08, + "logits/chosen": -2.775963068008423, + "logits/rejected": -2.75541615486145, + "logps/chosen": -242.49606323242188, + "logps/rejected": -206.7489471435547, + "loss": 0.6918, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.014242658391594887, + "rewards/margins": -0.001507654320448637, + "rewards/rejected": 0.01575031317770481, + "step": 4000 + }, + { + "epoch": 0.7, + "learning_rate": 8.055415617128462e-08, + "logits/chosen": -2.755798816680908, + "logits/rejected": -2.765866756439209, + "logps/chosen": -191.8464813232422, + "logps/rejected": -161.7691650390625, + "loss": 0.692, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.01425481028854847, + "rewards/margins": 0.0025988915003836155, + "rewards/rejected": 0.011655919253826141, + "step": 4010 + }, + { + "epoch": 0.7, + "learning_rate": 8.050377833753148e-08, + "logits/chosen": -2.7568089962005615, + "logits/rejected": -2.723388671875, + "logps/chosen": -220.6444549560547, + "logps/rejected": -215.7344207763672, + "loss": 0.6921, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.017022155225276947, + "rewards/margins": 0.004023154266178608, + "rewards/rejected": 0.012999000959098339, + "step": 4020 + }, + { + "epoch": 0.71, + "learning_rate": 8.045340050377833e-08, + "logits/chosen": -2.7698051929473877, + "logits/rejected": -2.76641583442688, + "logps/chosen": -201.69302368164062, + "logps/rejected": -167.20213317871094, + "loss": 0.6917, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.01841864362359047, + "rewards/margins": 0.004708954133093357, + "rewards/rejected": 0.013709688559174538, + "step": 4030 + }, + { + "epoch": 0.71, + "learning_rate": 8.040302267002519e-08, + "logits/chosen": -2.764843225479126, + "logits/rejected": -2.7504663467407227, + "logps/chosen": -206.3531036376953, + "logps/rejected": -201.3180694580078, + "loss": 0.691, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.014857729896903038, + "rewards/margins": 0.000497685105074197, + "rewards/rejected": 0.014360045082867146, + "step": 4040 + }, + { + "epoch": 0.71, + "learning_rate": 8.035264483627203e-08, + "logits/chosen": -2.724370241165161, + "logits/rejected": -2.7362284660339355, + "logps/chosen": -238.0730743408203, + "logps/rejected": -218.9322052001953, + "loss": 0.6915, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.02089729532599449, + "rewards/margins": 0.005764030385762453, + "rewards/rejected": 0.0151332663372159, + "step": 4050 + }, + { + "epoch": 0.71, + "learning_rate": 8.030226700251888e-08, + "logits/chosen": -2.831298351287842, + "logits/rejected": -2.840911865234375, + "logps/chosen": -247.79464721679688, + "logps/rejected": -244.6702117919922, + "loss": 0.6903, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.016922039911150932, + "rewards/margins": 0.001367938588373363, + "rewards/rejected": 0.015554102137684822, + "step": 4060 + }, + { + "epoch": 0.71, + "learning_rate": 8.025188916876575e-08, + "logits/chosen": -2.758810043334961, + "logits/rejected": -2.7609002590179443, + "logps/chosen": -188.1548614501953, + "logps/rejected": -150.46853637695312, + "loss": 0.6911, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.015438064932823181, + "rewards/margins": 0.00756922597065568, + "rewards/rejected": 0.007868838496506214, + "step": 4070 + }, + { + "epoch": 0.71, + "learning_rate": 8.02015113350126e-08, + "logits/chosen": -2.7641913890838623, + "logits/rejected": -2.794325113296509, + "logps/chosen": -276.16259765625, + "logps/rejected": -221.947509765625, + "loss": 0.6908, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.01936369575560093, + "rewards/margins": 0.004809045232832432, + "rewards/rejected": 0.014554649591445923, + "step": 4080 + }, + { + "epoch": 0.72, + "learning_rate": 8.015113350125944e-08, + "logits/chosen": -2.7735092639923096, + "logits/rejected": -2.7139530181884766, + "logps/chosen": -217.0701904296875, + "logps/rejected": -204.7127685546875, + "loss": 0.6905, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.01837734319269657, + "rewards/margins": 0.006126923952251673, + "rewards/rejected": 0.012250418774783611, + "step": 4090 + }, + { + "epoch": 0.72, + "learning_rate": 8.01007556675063e-08, + "logits/chosen": -2.746734380722046, + "logits/rejected": -2.779106616973877, + "logps/chosen": -223.3635711669922, + "logps/rejected": -210.4722137451172, + "loss": 0.6915, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.022333238273859024, + "rewards/margins": 0.005000376142561436, + "rewards/rejected": 0.017332863062620163, + "step": 4100 + }, + { + "epoch": 0.72, + "learning_rate": 8.005037783375315e-08, + "logits/chosen": -2.761756420135498, + "logits/rejected": -2.8026602268218994, + "logps/chosen": -221.0587158203125, + "logps/rejected": -202.43582153320312, + "loss": 0.6917, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.016418827697634697, + "rewards/margins": 0.0006193307344801724, + "rewards/rejected": 0.015799496322870255, + "step": 4110 + }, + { + "epoch": 0.72, + "learning_rate": 8e-08, + "logits/chosen": -2.7710421085357666, + "logits/rejected": -2.744896411895752, + "logps/chosen": -226.13107299804688, + "logps/rejected": -206.2400360107422, + "loss": 0.6908, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.018721196800470352, + "rewards/margins": 0.0020058993250131607, + "rewards/rejected": 0.01671529933810234, + "step": 4120 + }, + { + "epoch": 0.72, + "learning_rate": 7.994962216624684e-08, + "logits/chosen": -2.695394992828369, + "logits/rejected": -2.672240734100342, + "logps/chosen": -301.8807067871094, + "logps/rejected": -241.90768432617188, + "loss": 0.6907, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.02527024783194065, + "rewards/margins": 0.009704559110105038, + "rewards/rejected": 0.01556568592786789, + "step": 4130 + }, + { + "epoch": 0.73, + "learning_rate": 7.98992443324937e-08, + "logits/chosen": -2.7234575748443604, + "logits/rejected": -2.7253074645996094, + "logps/chosen": -242.5963897705078, + "logps/rejected": -214.54873657226562, + "loss": 0.6907, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.019268224015831947, + "rewards/margins": 0.0059552742168307304, + "rewards/rejected": 0.013312948867678642, + "step": 4140 + }, + { + "epoch": 0.73, + "learning_rate": 7.984886649874055e-08, + "logits/chosen": -2.747512102127075, + "logits/rejected": -2.750851631164551, + "logps/chosen": -221.0081787109375, + "logps/rejected": -218.8545684814453, + "loss": 0.6919, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0189188402146101, + "rewards/margins": 0.0030791780445724726, + "rewards/rejected": 0.01583966240286827, + "step": 4150 + }, + { + "epoch": 0.73, + "learning_rate": 7.97984886649874e-08, + "logits/chosen": -2.7558045387268066, + "logits/rejected": -2.7282321453094482, + "logps/chosen": -260.65093994140625, + "logps/rejected": -205.7612762451172, + "loss": 0.6902, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.01898707076907158, + "rewards/margins": 0.004444524645805359, + "rewards/rejected": 0.01454254798591137, + "step": 4160 + }, + { + "epoch": 0.73, + "learning_rate": 7.974811083123424e-08, + "logits/chosen": -2.740727663040161, + "logits/rejected": -2.738755702972412, + "logps/chosen": -255.1199951171875, + "logps/rejected": -223.3599395751953, + "loss": 0.6917, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.019392380490899086, + "rewards/margins": 0.0023465738631784916, + "rewards/rejected": 0.01704580709338188, + "step": 4170 + }, + { + "epoch": 0.73, + "learning_rate": 7.969773299748111e-08, + "logits/chosen": -2.7931790351867676, + "logits/rejected": -2.751844644546509, + "logps/chosen": -221.10107421875, + "logps/rejected": -173.9921875, + "loss": 0.6911, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.02068236656486988, + "rewards/margins": 0.00878697820007801, + "rewards/rejected": 0.011895387433469296, + "step": 4180 + }, + { + "epoch": 0.73, + "learning_rate": 7.964735516372796e-08, + "logits/chosen": -2.736713409423828, + "logits/rejected": -2.7641730308532715, + "logps/chosen": -243.8798370361328, + "logps/rejected": -209.95767211914062, + "loss": 0.6912, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.022618575021624565, + "rewards/margins": 0.006286067422479391, + "rewards/rejected": 0.016332510858774185, + "step": 4190 + }, + { + "epoch": 0.74, + "learning_rate": 7.959697732997482e-08, + "logits/chosen": -2.768643856048584, + "logits/rejected": -2.768256902694702, + "logps/chosen": -213.690673828125, + "logps/rejected": -223.6483917236328, + "loss": 0.6914, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.01731937564909458, + "rewards/margins": 0.0022180068772286177, + "rewards/rejected": 0.015101367607712746, + "step": 4200 + }, + { + "epoch": 0.74, + "learning_rate": 7.954659949622166e-08, + "logits/chosen": -2.7336461544036865, + "logits/rejected": -2.7381973266601562, + "logps/chosen": -266.1100769042969, + "logps/rejected": -220.54769897460938, + "loss": 0.6909, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.018683522939682007, + "rewards/margins": 0.004539954476058483, + "rewards/rejected": 0.014143568463623524, + "step": 4210 + }, + { + "epoch": 0.74, + "learning_rate": 7.949622166246851e-08, + "logits/chosen": -2.7625882625579834, + "logits/rejected": -2.7351088523864746, + "logps/chosen": -222.360107421875, + "logps/rejected": -187.1444549560547, + "loss": 0.6911, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.015518203377723694, + "rewards/margins": -0.0003775197546929121, + "rewards/rejected": 0.015895724296569824, + "step": 4220 + }, + { + "epoch": 0.74, + "learning_rate": 7.944584382871537e-08, + "logits/chosen": -2.8258113861083984, + "logits/rejected": -2.7792856693267822, + "logps/chosen": -265.05535888671875, + "logps/rejected": -232.38101196289062, + "loss": 0.6922, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.021588006988167763, + "rewards/margins": 0.001263659680262208, + "rewards/rejected": 0.02032434567809105, + "step": 4230 + }, + { + "epoch": 0.74, + "learning_rate": 7.939546599496222e-08, + "logits/chosen": -2.855884075164795, + "logits/rejected": -2.7981677055358887, + "logps/chosen": -241.37246704101562, + "logps/rejected": -197.73507690429688, + "loss": 0.6913, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.017666930332779884, + "rewards/margins": -0.0018121827160939574, + "rewards/rejected": 0.019479114562273026, + "step": 4240 + }, + { + "epoch": 0.74, + "learning_rate": 7.934508816120906e-08, + "logits/chosen": -2.769641160964966, + "logits/rejected": -2.7314181327819824, + "logps/chosen": -241.15615844726562, + "logps/rejected": -221.33547973632812, + "loss": 0.6911, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.023081984370946884, + "rewards/margins": 0.005661494564265013, + "rewards/rejected": 0.017420491203665733, + "step": 4250 + }, + { + "epoch": 0.75, + "learning_rate": 7.929471032745591e-08, + "logits/chosen": -2.743436813354492, + "logits/rejected": -2.6626510620117188, + "logps/chosen": -228.18014526367188, + "logps/rejected": -220.50277709960938, + "loss": 0.6914, + "rewards/accuracies": 0.3499999940395355, + "rewards/chosen": 0.01799473538994789, + "rewards/margins": -0.0007408105302602053, + "rewards/rejected": 0.018735546618700027, + "step": 4260 + }, + { + "epoch": 0.75, + "learning_rate": 7.924433249370277e-08, + "logits/chosen": -2.8057007789611816, + "logits/rejected": -2.7800495624542236, + "logps/chosen": -263.08514404296875, + "logps/rejected": -211.67666625976562, + "loss": 0.6907, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.02124876156449318, + "rewards/margins": 0.009110869839787483, + "rewards/rejected": 0.012137891724705696, + "step": 4270 + }, + { + "epoch": 0.75, + "learning_rate": 7.919395465994961e-08, + "logits/chosen": -2.7258174419403076, + "logits/rejected": -2.7756786346435547, + "logps/chosen": -193.611083984375, + "logps/rejected": -179.30149841308594, + "loss": 0.6917, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.016186311841011047, + "rewards/margins": 0.0020093251951038837, + "rewards/rejected": 0.0141769889742136, + "step": 4280 + }, + { + "epoch": 0.75, + "learning_rate": 7.914357682619647e-08, + "logits/chosen": -2.7517471313476562, + "logits/rejected": -2.734189987182617, + "logps/chosen": -230.6570281982422, + "logps/rejected": -202.70420837402344, + "loss": 0.6913, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.02114647440612316, + "rewards/margins": 0.0036278795450925827, + "rewards/rejected": 0.01751859486103058, + "step": 4290 + }, + { + "epoch": 0.75, + "learning_rate": 7.909319899244333e-08, + "logits/chosen": -2.730635166168213, + "logits/rejected": -2.7385268211364746, + "logps/chosen": -198.06155395507812, + "logps/rejected": -176.04498291015625, + "loss": 0.6911, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.016498813405632973, + "rewards/margins": 0.001804836094379425, + "rewards/rejected": 0.014693977311253548, + "step": 4300 + }, + { + "epoch": 0.75, + "learning_rate": 7.904282115869018e-08, + "logits/chosen": -2.7733383178710938, + "logits/rejected": -2.792484998703003, + "logps/chosen": -191.0068817138672, + "logps/rejected": -161.52700805664062, + "loss": 0.6915, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.014926761388778687, + "rewards/margins": 0.004622498992830515, + "rewards/rejected": 0.010304262861609459, + "step": 4310 + }, + { + "epoch": 0.76, + "learning_rate": 7.899244332493702e-08, + "logits/chosen": -2.768362522125244, + "logits/rejected": -2.8112378120422363, + "logps/chosen": -214.1084747314453, + "logps/rejected": -185.85166931152344, + "loss": 0.6909, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.018819646909832954, + "rewards/margins": 0.007635760121047497, + "rewards/rejected": 0.011183887720108032, + "step": 4320 + }, + { + "epoch": 0.76, + "learning_rate": 7.894206549118388e-08, + "logits/chosen": -2.7518534660339355, + "logits/rejected": -2.765934467315674, + "logps/chosen": -199.8416748046875, + "logps/rejected": -181.0721893310547, + "loss": 0.6917, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.018102090805768967, + "rewards/margins": -0.00039173493860289454, + "rewards/rejected": 0.01849382556974888, + "step": 4330 + }, + { + "epoch": 0.76, + "learning_rate": 7.889168765743073e-08, + "logits/chosen": -2.7839748859405518, + "logits/rejected": -2.7550039291381836, + "logps/chosen": -263.43011474609375, + "logps/rejected": -206.5287322998047, + "loss": 0.6909, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.02562366984784603, + "rewards/margins": 0.008644169196486473, + "rewards/rejected": 0.01697949692606926, + "step": 4340 + }, + { + "epoch": 0.76, + "learning_rate": 7.884130982367758e-08, + "logits/chosen": -2.734191417694092, + "logits/rejected": -2.6990275382995605, + "logps/chosen": -223.6094970703125, + "logps/rejected": -209.64791870117188, + "loss": 0.6911, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.01814252696931362, + "rewards/margins": 0.0009969560196623206, + "rewards/rejected": 0.017145570367574692, + "step": 4350 + }, + { + "epoch": 0.76, + "learning_rate": 7.879093198992442e-08, + "logits/chosen": -2.7549777030944824, + "logits/rejected": -2.7530622482299805, + "logps/chosen": -267.322998046875, + "logps/rejected": -225.5402069091797, + "loss": 0.6912, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.018788613379001617, + "rewards/margins": -0.0013716205721721053, + "rewards/rejected": 0.020160233601927757, + "step": 4360 + }, + { + "epoch": 0.77, + "learning_rate": 7.874055415617128e-08, + "logits/chosen": -2.8316569328308105, + "logits/rejected": -2.7772135734558105, + "logps/chosen": -238.33383178710938, + "logps/rejected": -207.7853240966797, + "loss": 0.6916, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.021232271566987038, + "rewards/margins": 0.0057861944660544395, + "rewards/rejected": 0.015446076169610023, + "step": 4370 + }, + { + "epoch": 0.77, + "learning_rate": 7.869017632241813e-08, + "logits/chosen": -2.7817704677581787, + "logits/rejected": -2.724588632583618, + "logps/chosen": -211.82650756835938, + "logps/rejected": -178.63743591308594, + "loss": 0.6916, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.01910659857094288, + "rewards/margins": 0.004909339360892773, + "rewards/rejected": 0.014197258278727531, + "step": 4380 + }, + { + "epoch": 0.77, + "learning_rate": 7.863979848866498e-08, + "logits/chosen": -2.7254724502563477, + "logits/rejected": -2.802567958831787, + "logps/chosen": -213.8620147705078, + "logps/rejected": -179.79685974121094, + "loss": 0.6911, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02377455309033394, + "rewards/margins": 0.004999110009521246, + "rewards/rejected": 0.018775442615151405, + "step": 4390 + }, + { + "epoch": 0.77, + "learning_rate": 7.858942065491184e-08, + "logits/chosen": -2.7992103099823, + "logits/rejected": -2.742579698562622, + "logps/chosen": -259.1708984375, + "logps/rejected": -212.4176483154297, + "loss": 0.6905, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.025623898953199387, + "rewards/margins": 0.008028807118535042, + "rewards/rejected": 0.017595095559954643, + "step": 4400 + }, + { + "epoch": 0.77, + "learning_rate": 7.853904282115869e-08, + "logits/chosen": -2.7983293533325195, + "logits/rejected": -2.760340929031372, + "logps/chosen": -238.68203735351562, + "logps/rejected": -205.7268524169922, + "loss": 0.6889, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.022161977365612984, + "rewards/margins": 0.008466407656669617, + "rewards/rejected": 0.013695569708943367, + "step": 4410 + }, + { + "epoch": 0.77, + "learning_rate": 7.848866498740554e-08, + "logits/chosen": -2.7707414627075195, + "logits/rejected": -2.666015148162842, + "logps/chosen": -267.7262268066406, + "logps/rejected": -229.92568969726562, + "loss": 0.6911, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.02798035740852356, + "rewards/margins": 0.0134460823610425, + "rewards/rejected": 0.01453427691012621, + "step": 4420 + }, + { + "epoch": 0.78, + "learning_rate": 7.84382871536524e-08, + "logits/chosen": -2.7728307247161865, + "logits/rejected": -2.748939275741577, + "logps/chosen": -241.35791015625, + "logps/rejected": -208.1006622314453, + "loss": 0.6919, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02361791953444481, + "rewards/margins": 0.006282551679760218, + "rewards/rejected": 0.01733536645770073, + "step": 4430 + }, + { + "epoch": 0.78, + "learning_rate": 7.838790931989924e-08, + "logits/chosen": -2.751283645629883, + "logits/rejected": -2.7884583473205566, + "logps/chosen": -230.86865234375, + "logps/rejected": -205.05746459960938, + "loss": 0.6905, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.01816331408917904, + "rewards/margins": 0.0020460118539631367, + "rewards/rejected": 0.01611730083823204, + "step": 4440 + }, + { + "epoch": 0.78, + "learning_rate": 7.833753148614609e-08, + "logits/chosen": -2.7546162605285645, + "logits/rejected": -2.7503271102905273, + "logps/chosen": -237.634765625, + "logps/rejected": -209.13125610351562, + "loss": 0.6905, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.021774889901280403, + "rewards/margins": 0.007742063608020544, + "rewards/rejected": 0.014032823964953423, + "step": 4450 + }, + { + "epoch": 0.78, + "learning_rate": 7.828715365239295e-08, + "logits/chosen": -2.7621121406555176, + "logits/rejected": -2.7742960453033447, + "logps/chosen": -217.29983520507812, + "logps/rejected": -208.7975616455078, + "loss": 0.6914, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.023997284471988678, + "rewards/margins": 0.005684687290340662, + "rewards/rejected": 0.018312597647309303, + "step": 4460 + }, + { + "epoch": 0.78, + "learning_rate": 7.82367758186398e-08, + "logits/chosen": -2.711585521697998, + "logits/rejected": -2.713052988052368, + "logps/chosen": -249.82479858398438, + "logps/rejected": -200.6315155029297, + "loss": 0.692, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.019304895773530006, + "rewards/margins": 0.0010892207501456141, + "rewards/rejected": 0.01821567490696907, + "step": 4470 + }, + { + "epoch": 0.78, + "learning_rate": 7.818639798488664e-08, + "logits/chosen": -2.705024242401123, + "logits/rejected": -2.74556565284729, + "logps/chosen": -194.25546264648438, + "logps/rejected": -171.3458251953125, + "loss": 0.6905, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.011694484390318394, + "rewards/margins": 0.0016950942808762193, + "rewards/rejected": 0.009999390691518784, + "step": 4480 + }, + { + "epoch": 0.79, + "learning_rate": 7.81360201511335e-08, + "logits/chosen": -2.7292304039001465, + "logits/rejected": -2.7129428386688232, + "logps/chosen": -209.78079223632812, + "logps/rejected": -241.6830291748047, + "loss": 0.6911, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.012067977339029312, + "rewards/margins": -0.0037381560541689396, + "rewards/rejected": 0.015806132927536964, + "step": 4490 + }, + { + "epoch": 0.79, + "learning_rate": 7.808564231738035e-08, + "logits/chosen": -2.8351051807403564, + "logits/rejected": -2.7264862060546875, + "logps/chosen": -220.93252563476562, + "logps/rejected": -205.50259399414062, + "loss": 0.6917, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.02219536155462265, + "rewards/margins": 0.00513820443302393, + "rewards/rejected": 0.017057154327630997, + "step": 4500 + }, + { + "epoch": 0.79, + "learning_rate": 7.80352644836272e-08, + "logits/chosen": -2.785386323928833, + "logits/rejected": -2.7174456119537354, + "logps/chosen": -234.05874633789062, + "logps/rejected": -205.1448974609375, + "loss": 0.6909, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.018111255019903183, + "rewards/margins": 0.004342755768448114, + "rewards/rejected": 0.013768496923148632, + "step": 4510 + }, + { + "epoch": 0.79, + "learning_rate": 7.798488664987405e-08, + "logits/chosen": -2.7610111236572266, + "logits/rejected": -2.6893057823181152, + "logps/chosen": -215.45077514648438, + "logps/rejected": -212.09848022460938, + "loss": 0.6914, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.01872086152434349, + "rewards/margins": -0.00038822871283628047, + "rewards/rejected": 0.01910909079015255, + "step": 4520 + }, + { + "epoch": 0.79, + "learning_rate": 7.793450881612091e-08, + "logits/chosen": -2.790309429168701, + "logits/rejected": -2.8239731788635254, + "logps/chosen": -251.9709014892578, + "logps/rejected": -204.56088256835938, + "loss": 0.6902, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.02696056105196476, + "rewards/margins": 0.0066688829101622105, + "rewards/rejected": 0.020291678607463837, + "step": 4530 + }, + { + "epoch": 0.8, + "learning_rate": 7.788413098236776e-08, + "logits/chosen": -2.8395566940307617, + "logits/rejected": -2.781035900115967, + "logps/chosen": -239.2814483642578, + "logps/rejected": -189.88824462890625, + "loss": 0.6907, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.022276435047388077, + "rewards/margins": 0.00612932164222002, + "rewards/rejected": 0.01614711619913578, + "step": 4540 + }, + { + "epoch": 0.8, + "learning_rate": 7.783375314861462e-08, + "logits/chosen": -2.777453899383545, + "logits/rejected": -2.7720651626586914, + "logps/chosen": -277.6221008300781, + "logps/rejected": -232.5399932861328, + "loss": 0.6914, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.022800957784056664, + "rewards/margins": 0.006417891476303339, + "rewards/rejected": 0.016383066773414612, + "step": 4550 + }, + { + "epoch": 0.8, + "learning_rate": 7.778337531486146e-08, + "logits/chosen": -2.8126351833343506, + "logits/rejected": -2.748579263687134, + "logps/chosen": -235.12881469726562, + "logps/rejected": -250.25527954101562, + "loss": 0.6913, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.024302994832396507, + "rewards/margins": 0.005716138519346714, + "rewards/rejected": 0.01858685538172722, + "step": 4560 + }, + { + "epoch": 0.8, + "learning_rate": 7.773299748110831e-08, + "logits/chosen": -2.7417664527893066, + "logits/rejected": -2.736534833908081, + "logps/chosen": -251.11880493164062, + "logps/rejected": -205.9317169189453, + "loss": 0.6902, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.021253764629364014, + "rewards/margins": 0.006818639580160379, + "rewards/rejected": 0.014435125514864922, + "step": 4570 + }, + { + "epoch": 0.8, + "learning_rate": 7.768261964735516e-08, + "logits/chosen": -2.879304885864258, + "logits/rejected": -2.8242783546447754, + "logps/chosen": -260.59454345703125, + "logps/rejected": -209.79367065429688, + "loss": 0.6904, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.0261318888515234, + "rewards/margins": 0.007015122566372156, + "rewards/rejected": 0.01911676675081253, + "step": 4580 + }, + { + "epoch": 0.8, + "learning_rate": 7.7632241813602e-08, + "logits/chosen": -2.7443363666534424, + "logits/rejected": -2.663283348083496, + "logps/chosen": -227.0984649658203, + "logps/rejected": -207.4261016845703, + "loss": 0.691, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.020075734704732895, + "rewards/margins": 0.0018470725044608116, + "rewards/rejected": 0.01822866126894951, + "step": 4590 + }, + { + "epoch": 0.81, + "learning_rate": 7.758186397984886e-08, + "logits/chosen": -2.765794277191162, + "logits/rejected": -2.7267675399780273, + "logps/chosen": -227.9505615234375, + "logps/rejected": -175.19935607910156, + "loss": 0.6886, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.01690318062901497, + "rewards/margins": 0.005889912601560354, + "rewards/rejected": 0.011013267561793327, + "step": 4600 + }, + { + "epoch": 0.81, + "learning_rate": 7.753148614609571e-08, + "logits/chosen": -2.7460758686065674, + "logits/rejected": -2.7646918296813965, + "logps/chosen": -255.68576049804688, + "logps/rejected": -223.80899047851562, + "loss": 0.6902, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.025373512879014015, + "rewards/margins": 0.004764680750668049, + "rewards/rejected": 0.02060883305966854, + "step": 4610 + }, + { + "epoch": 0.81, + "learning_rate": 7.748110831234256e-08, + "logits/chosen": -2.7983150482177734, + "logits/rejected": -2.815904140472412, + "logps/chosen": -246.80892944335938, + "logps/rejected": -207.28793334960938, + "loss": 0.6924, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.02356107532978058, + "rewards/margins": 0.0033489782363176346, + "rewards/rejected": 0.020212098956108093, + "step": 4620 + }, + { + "epoch": 0.81, + "learning_rate": 7.743073047858942e-08, + "logits/chosen": -2.726724147796631, + "logits/rejected": -2.7251830101013184, + "logps/chosen": -203.96339416503906, + "logps/rejected": -179.08773803710938, + "loss": 0.6912, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.018438972532749176, + "rewards/margins": 0.0032338383607566357, + "rewards/rejected": 0.015205135568976402, + "step": 4630 + }, + { + "epoch": 0.81, + "learning_rate": 7.738035264483627e-08, + "logits/chosen": -2.799243688583374, + "logits/rejected": -2.757625102996826, + "logps/chosen": -231.72024536132812, + "logps/rejected": -194.36715698242188, + "loss": 0.6908, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.02035854198038578, + "rewards/margins": 0.003642552299425006, + "rewards/rejected": 0.016715990379452705, + "step": 4640 + }, + { + "epoch": 0.81, + "learning_rate": 7.732997481108313e-08, + "logits/chosen": -2.8015732765197754, + "logits/rejected": -2.7627758979797363, + "logps/chosen": -225.84866333007812, + "logps/rejected": -202.64268493652344, + "loss": 0.6912, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.017703380435705185, + "rewards/margins": 0.0011888284934684634, + "rewards/rejected": 0.016514552757143974, + "step": 4650 + }, + { + "epoch": 0.82, + "learning_rate": 7.727959697732998e-08, + "logits/chosen": -2.7188124656677246, + "logits/rejected": -2.758882522583008, + "logps/chosen": -228.21188354492188, + "logps/rejected": -214.9092254638672, + "loss": 0.6903, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.024845756590366364, + "rewards/margins": 0.006363884545862675, + "rewards/rejected": 0.018481872975826263, + "step": 4660 + }, + { + "epoch": 0.82, + "learning_rate": 7.722921914357682e-08, + "logits/chosen": -2.81644344329834, + "logits/rejected": -2.7707905769348145, + "logps/chosen": -243.9435272216797, + "logps/rejected": -188.6251983642578, + "loss": 0.69, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.026427235454320908, + "rewards/margins": 0.011382916942238808, + "rewards/rejected": 0.015044321306049824, + "step": 4670 + }, + { + "epoch": 0.82, + "learning_rate": 7.717884130982367e-08, + "logits/chosen": -2.7194998264312744, + "logits/rejected": -2.8078126907348633, + "logps/chosen": -220.48046875, + "logps/rejected": -195.44012451171875, + "loss": 0.6904, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.019193807616829872, + "rewards/margins": 0.003940016962587833, + "rewards/rejected": 0.015253791585564613, + "step": 4680 + }, + { + "epoch": 0.82, + "learning_rate": 7.712846347607053e-08, + "logits/chosen": -2.745544910430908, + "logits/rejected": -2.796077013015747, + "logps/chosen": -242.34103393554688, + "logps/rejected": -186.40908813476562, + "loss": 0.6915, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.02268916554749012, + "rewards/margins": 0.006848675664514303, + "rewards/rejected": 0.01584048941731453, + "step": 4690 + }, + { + "epoch": 0.82, + "learning_rate": 7.707808564231738e-08, + "logits/chosen": -2.7313311100006104, + "logits/rejected": -2.718033790588379, + "logps/chosen": -180.11282348632812, + "logps/rejected": -193.9093780517578, + "loss": 0.691, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.013201892375946045, + "rewards/margins": 0.001982487738132477, + "rewards/rejected": 0.011219402775168419, + "step": 4700 + }, + { + "epoch": 0.83, + "learning_rate": 7.702770780856422e-08, + "logits/chosen": -2.7362091541290283, + "logits/rejected": -2.6564507484436035, + "logps/chosen": -245.69277954101562, + "logps/rejected": -222.1023406982422, + "loss": 0.6913, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.024562204256653786, + "rewards/margins": 0.0058278171345591545, + "rewards/rejected": 0.018734386190772057, + "step": 4710 + }, + { + "epoch": 0.83, + "learning_rate": 7.697732997481107e-08, + "logits/chosen": -2.7647807598114014, + "logits/rejected": -2.748202323913574, + "logps/chosen": -207.46826171875, + "logps/rejected": -204.72366333007812, + "loss": 0.6903, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.017461542040109634, + "rewards/margins": -1.7283111446886323e-05, + "rewards/rejected": 0.01747882552444935, + "step": 4720 + }, + { + "epoch": 0.83, + "learning_rate": 7.692695214105793e-08, + "logits/chosen": -2.8048958778381348, + "logits/rejected": -2.830275058746338, + "logps/chosen": -256.74993896484375, + "logps/rejected": -186.250732421875, + "loss": 0.691, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02503347396850586, + "rewards/margins": 0.007637057453393936, + "rewards/rejected": 0.017396416515111923, + "step": 4730 + }, + { + "epoch": 0.83, + "learning_rate": 7.687657430730478e-08, + "logits/chosen": -2.7937734127044678, + "logits/rejected": -2.771660089492798, + "logps/chosen": -243.90585327148438, + "logps/rejected": -215.63577270507812, + "loss": 0.6915, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.021137814968824387, + "rewards/margins": -0.0011193671962246299, + "rewards/rejected": 0.022257182747125626, + "step": 4740 + }, + { + "epoch": 0.83, + "learning_rate": 7.682619647355164e-08, + "logits/chosen": -2.7488274574279785, + "logits/rejected": -2.817153215408325, + "logps/chosen": -236.9940643310547, + "logps/rejected": -228.24642944335938, + "loss": 0.6908, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.024236269295215607, + "rewards/margins": 0.002860927488654852, + "rewards/rejected": 0.021375341340899467, + "step": 4750 + }, + { + "epoch": 0.83, + "learning_rate": 7.677581863979849e-08, + "logits/chosen": -2.7421677112579346, + "logits/rejected": -2.767341375350952, + "logps/chosen": -226.1661834716797, + "logps/rejected": -179.6350860595703, + "loss": 0.6901, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.027445446699857712, + "rewards/margins": 0.007057595998048782, + "rewards/rejected": 0.02038785070180893, + "step": 4760 + }, + { + "epoch": 0.84, + "learning_rate": 7.672544080604534e-08, + "logits/chosen": -2.817746877670288, + "logits/rejected": -2.760152578353882, + "logps/chosen": -229.91854858398438, + "logps/rejected": -194.99644470214844, + "loss": 0.6915, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.02216922864317894, + "rewards/margins": 0.008342455141246319, + "rewards/rejected": 0.013826772570610046, + "step": 4770 + }, + { + "epoch": 0.84, + "learning_rate": 7.66750629722922e-08, + "logits/chosen": -2.8346447944641113, + "logits/rejected": -2.751246690750122, + "logps/chosen": -250.40609741210938, + "logps/rejected": -210.5948944091797, + "loss": 0.6904, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.024279357865452766, + "rewards/margins": 0.005712731741368771, + "rewards/rejected": 0.01856662891805172, + "step": 4780 + }, + { + "epoch": 0.84, + "learning_rate": 7.662468513853904e-08, + "logits/chosen": -2.7878410816192627, + "logits/rejected": -2.7772955894470215, + "logps/chosen": -237.049560546875, + "logps/rejected": -193.94973754882812, + "loss": 0.6915, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.021299934014678, + "rewards/margins": 0.004049413371831179, + "rewards/rejected": 0.01725051924586296, + "step": 4790 + }, + { + "epoch": 0.84, + "learning_rate": 7.657430730478589e-08, + "logits/chosen": -2.7216315269470215, + "logits/rejected": -2.725965976715088, + "logps/chosen": -260.41021728515625, + "logps/rejected": -253.3103790283203, + "loss": 0.692, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.025030773133039474, + "rewards/margins": 0.001364406431093812, + "rewards/rejected": 0.023666368797421455, + "step": 4800 + }, + { + "epoch": 0.84, + "learning_rate": 7.652392947103274e-08, + "logits/chosen": -2.7526895999908447, + "logits/rejected": -2.783440589904785, + "logps/chosen": -233.69204711914062, + "logps/rejected": -257.5528564453125, + "loss": 0.6915, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.0172027088701725, + "rewards/margins": -0.000673537200782448, + "rewards/rejected": 0.017876241356134415, + "step": 4810 + }, + { + "epoch": 0.84, + "learning_rate": 7.64735516372796e-08, + "logits/chosen": -2.697016477584839, + "logits/rejected": -2.7442197799682617, + "logps/chosen": -241.70361328125, + "logps/rejected": -219.9405059814453, + "loss": 0.6904, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.028333717957139015, + "rewards/margins": 0.009502708911895752, + "rewards/rejected": 0.018831010907888412, + "step": 4820 + }, + { + "epoch": 0.85, + "learning_rate": 7.642317380352644e-08, + "logits/chosen": -2.792147397994995, + "logits/rejected": -2.752933979034424, + "logps/chosen": -263.72259521484375, + "logps/rejected": -222.4014434814453, + "loss": 0.6912, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.023669295012950897, + "rewards/margins": 0.0015563804190605879, + "rewards/rejected": 0.02211291715502739, + "step": 4830 + }, + { + "epoch": 0.85, + "learning_rate": 7.637279596977329e-08, + "logits/chosen": -2.744185447692871, + "logits/rejected": -2.718427896499634, + "logps/chosen": -266.70318603515625, + "logps/rejected": -220.90786743164062, + "loss": 0.6904, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.02698015235364437, + "rewards/margins": 0.007942819967865944, + "rewards/rejected": 0.019037332385778427, + "step": 4840 + }, + { + "epoch": 0.85, + "learning_rate": 7.632241813602014e-08, + "logits/chosen": -2.786680221557617, + "logits/rejected": -2.7786288261413574, + "logps/chosen": -223.2958221435547, + "logps/rejected": -175.2308807373047, + "loss": 0.6914, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.019782308489084244, + "rewards/margins": 0.007503434084355831, + "rewards/rejected": 0.012278875336050987, + "step": 4850 + }, + { + "epoch": 0.85, + "learning_rate": 7.6272040302267e-08, + "logits/chosen": -2.7439236640930176, + "logits/rejected": -2.754936695098877, + "logps/chosen": -196.223876953125, + "logps/rejected": -198.14244079589844, + "loss": 0.6913, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.021982144564390182, + "rewards/margins": 0.003115237457677722, + "rewards/rejected": 0.018866905942559242, + "step": 4860 + }, + { + "epoch": 0.85, + "learning_rate": 7.622166246851385e-08, + "logits/chosen": -2.718632221221924, + "logits/rejected": -2.7445740699768066, + "logps/chosen": -230.5083465576172, + "logps/rejected": -186.44937133789062, + "loss": 0.6923, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.026937445625662804, + "rewards/margins": 0.0090105552226305, + "rewards/rejected": 0.017926890403032303, + "step": 4870 + }, + { + "epoch": 0.85, + "learning_rate": 7.61712846347607e-08, + "logits/chosen": -2.8068249225616455, + "logits/rejected": -2.7692713737487793, + "logps/chosen": -246.0875701904297, + "logps/rejected": -199.01675415039062, + "loss": 0.6914, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.02345597743988037, + "rewards/margins": 0.007212613709270954, + "rewards/rejected": 0.01624336466193199, + "step": 4880 + }, + { + "epoch": 0.86, + "learning_rate": 7.612090680100756e-08, + "logits/chosen": -2.745042324066162, + "logits/rejected": -2.815016746520996, + "logps/chosen": -257.94610595703125, + "logps/rejected": -189.48870849609375, + "loss": 0.6908, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.023482834920287132, + "rewards/margins": 0.006505007389932871, + "rewards/rejected": 0.01697782799601555, + "step": 4890 + }, + { + "epoch": 0.86, + "learning_rate": 7.60705289672544e-08, + "logits/chosen": -2.661994695663452, + "logits/rejected": -2.670673131942749, + "logps/chosen": -239.2667236328125, + "logps/rejected": -215.118408203125, + "loss": 0.6902, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.029827941209077835, + "rewards/margins": 0.0076766968704760075, + "rewards/rejected": 0.022151242941617966, + "step": 4900 + }, + { + "epoch": 0.86, + "learning_rate": 7.602015113350125e-08, + "logits/chosen": -2.7965893745422363, + "logits/rejected": -2.8132386207580566, + "logps/chosen": -246.4945831298828, + "logps/rejected": -211.777587890625, + "loss": 0.6912, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.0261533260345459, + "rewards/margins": 0.006919356994330883, + "rewards/rejected": 0.01923396997153759, + "step": 4910 + }, + { + "epoch": 0.86, + "learning_rate": 7.596977329974811e-08, + "logits/chosen": -2.790916919708252, + "logits/rejected": -2.753495693206787, + "logps/chosen": -231.7954864501953, + "logps/rejected": -226.02127075195312, + "loss": 0.6912, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.021478954702615738, + "rewards/margins": 0.001239580800756812, + "rewards/rejected": 0.020239371806383133, + "step": 4920 + }, + { + "epoch": 0.86, + "learning_rate": 7.591939546599496e-08, + "logits/chosen": -2.7043099403381348, + "logits/rejected": -2.789663314819336, + "logps/chosen": -261.9654541015625, + "logps/rejected": -234.9620361328125, + "loss": 0.6906, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03034358285367489, + "rewards/margins": 0.005865463055670261, + "rewards/rejected": 0.024478118866682053, + "step": 4930 + }, + { + "epoch": 0.87, + "learning_rate": 7.58690176322418e-08, + "logits/chosen": -2.813978672027588, + "logits/rejected": -2.751081943511963, + "logps/chosen": -250.8798370361328, + "logps/rejected": -239.74002075195312, + "loss": 0.6918, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.028360417112708092, + "rewards/margins": 0.006048205774277449, + "rewards/rejected": 0.022312210872769356, + "step": 4940 + }, + { + "epoch": 0.87, + "learning_rate": 7.581863979848865e-08, + "logits/chosen": -2.7854201793670654, + "logits/rejected": -2.7969956398010254, + "logps/chosen": -218.26541137695312, + "logps/rejected": -190.56585693359375, + "loss": 0.6916, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.02540905773639679, + "rewards/margins": 0.004594909492880106, + "rewards/rejected": 0.02081414684653282, + "step": 4950 + }, + { + "epoch": 0.87, + "learning_rate": 7.576826196473551e-08, + "logits/chosen": -2.758981943130493, + "logits/rejected": -2.732278347015381, + "logps/chosen": -238.2212371826172, + "logps/rejected": -241.3662872314453, + "loss": 0.6913, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.024932190775871277, + "rewards/margins": 0.002725116442888975, + "rewards/rejected": 0.022207075729966164, + "step": 4960 + }, + { + "epoch": 0.87, + "learning_rate": 7.571788413098236e-08, + "logits/chosen": -2.749824285507202, + "logits/rejected": -2.7466375827789307, + "logps/chosen": -263.97076416015625, + "logps/rejected": -213.78076171875, + "loss": 0.6899, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.03015116974711418, + "rewards/margins": 0.01208040677011013, + "rewards/rejected": 0.0180707648396492, + "step": 4970 + }, + { + "epoch": 0.87, + "learning_rate": 7.566750629722922e-08, + "logits/chosen": -2.728415012359619, + "logits/rejected": -2.7121329307556152, + "logps/chosen": -240.95773315429688, + "logps/rejected": -253.390380859375, + "loss": 0.6916, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.02616221271455288, + "rewards/margins": 0.0012474370887503028, + "rewards/rejected": 0.024914775043725967, + "step": 4980 + }, + { + "epoch": 0.87, + "learning_rate": 7.561712846347607e-08, + "logits/chosen": -2.7221524715423584, + "logits/rejected": -2.7137563228607178, + "logps/chosen": -244.83627319335938, + "logps/rejected": -194.1187744140625, + "loss": 0.6905, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.023836804553866386, + "rewards/margins": 0.005772692617028952, + "rewards/rejected": 0.018064109608530998, + "step": 4990 + }, + { + "epoch": 0.88, + "learning_rate": 7.556675062972292e-08, + "logits/chosen": -2.7389016151428223, + "logits/rejected": -2.7844491004943848, + "logps/chosen": -258.43865966796875, + "logps/rejected": -235.6800079345703, + "loss": 0.6902, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.024131130427122116, + "rewards/margins": 0.007521049585193396, + "rewards/rejected": 0.016610082238912582, + "step": 5000 + }, + { + "epoch": 0.88, + "learning_rate": 7.551637279596978e-08, + "logits/chosen": -2.7731165885925293, + "logits/rejected": -2.6811578273773193, + "logps/chosen": -205.5344696044922, + "logps/rejected": -183.38037109375, + "loss": 0.6902, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.016569796949625015, + "rewards/margins": -0.002280243206769228, + "rewards/rejected": 0.018850039690732956, + "step": 5010 + }, + { + "epoch": 0.88, + "learning_rate": 7.546599496221662e-08, + "logits/chosen": -2.7271320819854736, + "logits/rejected": -2.809903144836426, + "logps/chosen": -206.69082641601562, + "logps/rejected": -222.5525360107422, + "loss": 0.6902, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.017895519733428955, + "rewards/margins": 0.00183036585804075, + "rewards/rejected": 0.01606515422463417, + "step": 5020 + }, + { + "epoch": 0.88, + "learning_rate": 7.541561712846347e-08, + "logits/chosen": -2.7593743801116943, + "logits/rejected": -2.7369823455810547, + "logps/chosen": -215.10879516601562, + "logps/rejected": -209.2699737548828, + "loss": 0.6911, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.023434340953826904, + "rewards/margins": 0.00012367055751383305, + "rewards/rejected": 0.023310670629143715, + "step": 5030 + }, + { + "epoch": 0.88, + "learning_rate": 7.536523929471032e-08, + "logits/chosen": -2.748511791229248, + "logits/rejected": -2.74576997756958, + "logps/chosen": -233.9241180419922, + "logps/rejected": -241.55917358398438, + "loss": 0.6903, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.02254708856344223, + "rewards/margins": 0.002134478185325861, + "rewards/rejected": 0.020412612706422806, + "step": 5040 + }, + { + "epoch": 0.88, + "learning_rate": 7.531486146095718e-08, + "logits/chosen": -2.7883503437042236, + "logits/rejected": -2.765450954437256, + "logps/chosen": -194.64598083496094, + "logps/rejected": -229.24850463867188, + "loss": 0.6905, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.024526655673980713, + "rewards/margins": -0.0027814474888145924, + "rewards/rejected": 0.027308102697134018, + "step": 5050 + }, + { + "epoch": 0.89, + "learning_rate": 7.526448362720402e-08, + "logits/chosen": -2.714806318283081, + "logits/rejected": -2.6766140460968018, + "logps/chosen": -248.44253540039062, + "logps/rejected": -229.79556274414062, + "loss": 0.6907, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.027913689613342285, + "rewards/margins": 0.005528334993869066, + "rewards/rejected": 0.022385356947779655, + "step": 5060 + }, + { + "epoch": 0.89, + "learning_rate": 7.521410579345087e-08, + "logits/chosen": -2.7708027362823486, + "logits/rejected": -2.7898004055023193, + "logps/chosen": -224.08193969726562, + "logps/rejected": -220.9014129638672, + "loss": 0.6907, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.027087047696113586, + "rewards/margins": 0.004851869307458401, + "rewards/rejected": 0.02223517931997776, + "step": 5070 + }, + { + "epoch": 0.89, + "learning_rate": 7.516372795969773e-08, + "logits/chosen": -2.7174248695373535, + "logits/rejected": -2.741032123565674, + "logps/chosen": -198.52511596679688, + "logps/rejected": -177.54678344726562, + "loss": 0.6893, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.020215127617120743, + "rewards/margins": 0.0038847383111715317, + "rewards/rejected": 0.016330387443304062, + "step": 5080 + }, + { + "epoch": 0.89, + "learning_rate": 7.511335012594458e-08, + "logits/chosen": -2.718716859817505, + "logits/rejected": -2.748931407928467, + "logps/chosen": -251.72378540039062, + "logps/rejected": -226.3111114501953, + "loss": 0.6916, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02789355255663395, + "rewards/margins": 0.0028011654503643513, + "rewards/rejected": 0.025092383846640587, + "step": 5090 + }, + { + "epoch": 0.89, + "learning_rate": 7.506297229219143e-08, + "logits/chosen": -2.720767021179199, + "logits/rejected": -2.744206666946411, + "logps/chosen": -257.54852294921875, + "logps/rejected": -162.34461975097656, + "loss": 0.6903, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.029418539255857468, + "rewards/margins": 0.013503951020538807, + "rewards/rejected": 0.015914589166641235, + "step": 5100 + }, + { + "epoch": 0.9, + "learning_rate": 7.501259445843829e-08, + "logits/chosen": -2.801480293273926, + "logits/rejected": -2.8004708290100098, + "logps/chosen": -250.4967803955078, + "logps/rejected": -197.5179901123047, + "loss": 0.6895, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.024577541276812553, + "rewards/margins": 0.010709354653954506, + "rewards/rejected": 0.013868187554180622, + "step": 5110 + }, + { + "epoch": 0.9, + "learning_rate": 7.496221662468514e-08, + "logits/chosen": -2.754500389099121, + "logits/rejected": -2.7321605682373047, + "logps/chosen": -211.9841766357422, + "logps/rejected": -153.45176696777344, + "loss": 0.6904, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.02272544428706169, + "rewards/margins": 0.012496823444962502, + "rewards/rejected": 0.01022862084209919, + "step": 5120 + }, + { + "epoch": 0.9, + "learning_rate": 7.4911838790932e-08, + "logits/chosen": -2.765127658843994, + "logits/rejected": -2.803529739379883, + "logps/chosen": -265.0037841796875, + "logps/rejected": -221.8296661376953, + "loss": 0.69, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03228873759508133, + "rewards/margins": 0.007724687457084656, + "rewards/rejected": 0.024564048275351524, + "step": 5130 + }, + { + "epoch": 0.9, + "learning_rate": 7.486146095717883e-08, + "logits/chosen": -2.739295482635498, + "logits/rejected": -2.737955093383789, + "logps/chosen": -210.24307250976562, + "logps/rejected": -197.39566040039062, + "loss": 0.691, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.01834609918296337, + "rewards/margins": 0.0016159085789695382, + "rewards/rejected": 0.016730191186070442, + "step": 5140 + }, + { + "epoch": 0.9, + "learning_rate": 7.481108312342569e-08, + "logits/chosen": -2.8013620376586914, + "logits/rejected": -2.766737461090088, + "logps/chosen": -246.08480834960938, + "logps/rejected": -205.478759765625, + "loss": 0.6912, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.024060197174549103, + "rewards/margins": 0.003503562416881323, + "rewards/rejected": 0.020556632429361343, + "step": 5150 + }, + { + "epoch": 0.9, + "learning_rate": 7.476070528967254e-08, + "logits/chosen": -2.8327503204345703, + "logits/rejected": -2.825082302093506, + "logps/chosen": -218.51394653320312, + "logps/rejected": -197.2113800048828, + "loss": 0.6913, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.025230538100004196, + "rewards/margins": 0.002071975963190198, + "rewards/rejected": 0.023158561438322067, + "step": 5160 + }, + { + "epoch": 0.91, + "learning_rate": 7.47103274559194e-08, + "logits/chosen": -2.721312999725342, + "logits/rejected": -2.7535860538482666, + "logps/chosen": -210.86325073242188, + "logps/rejected": -202.97125244140625, + "loss": 0.6902, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.01850944198668003, + "rewards/margins": 0.002257524523884058, + "rewards/rejected": 0.01625191606581211, + "step": 5170 + }, + { + "epoch": 0.91, + "learning_rate": 7.465994962216624e-08, + "logits/chosen": -2.7364120483398438, + "logits/rejected": -2.808478355407715, + "logps/chosen": -236.8877716064453, + "logps/rejected": -233.90103149414062, + "loss": 0.6913, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.02594706416130066, + "rewards/margins": 0.0006133163697086275, + "rewards/rejected": 0.025333750993013382, + "step": 5180 + }, + { + "epoch": 0.91, + "learning_rate": 7.460957178841309e-08, + "logits/chosen": -2.789334535598755, + "logits/rejected": -2.7878098487854004, + "logps/chosen": -246.96987915039062, + "logps/rejected": -218.8030548095703, + "loss": 0.6911, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02684968151152134, + "rewards/margins": 0.00774233415722847, + "rewards/rejected": 0.019107351079583168, + "step": 5190 + }, + { + "epoch": 0.91, + "learning_rate": 7.455919395465994e-08, + "logits/chosen": -2.6209568977355957, + "logits/rejected": -2.766512870788574, + "logps/chosen": -260.9529113769531, + "logps/rejected": -207.5177459716797, + "loss": 0.6897, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02858014777302742, + "rewards/margins": 0.006817141082137823, + "rewards/rejected": 0.02176300808787346, + "step": 5200 + }, + { + "epoch": 0.91, + "learning_rate": 7.45088161209068e-08, + "logits/chosen": -2.7715020179748535, + "logits/rejected": -2.7795920372009277, + "logps/chosen": -250.96273803710938, + "logps/rejected": -235.0276336669922, + "loss": 0.6909, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.027890939265489578, + "rewards/margins": -0.0006950365495868027, + "rewards/rejected": 0.028585975989699364, + "step": 5210 + }, + { + "epoch": 0.91, + "learning_rate": 7.445843828715365e-08, + "logits/chosen": -2.709684133529663, + "logits/rejected": -2.7793078422546387, + "logps/chosen": -239.56918334960938, + "logps/rejected": -206.3387908935547, + "loss": 0.6904, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.027700409293174744, + "rewards/margins": 0.007622907869517803, + "rewards/rejected": 0.020077500492334366, + "step": 5220 + }, + { + "epoch": 0.92, + "learning_rate": 7.44080604534005e-08, + "logits/chosen": -2.7601256370544434, + "logits/rejected": -2.716702461242676, + "logps/chosen": -233.1493377685547, + "logps/rejected": -227.4046173095703, + "loss": 0.6898, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.028554772958159447, + "rewards/margins": 0.009560917504131794, + "rewards/rejected": 0.018993858247995377, + "step": 5230 + }, + { + "epoch": 0.92, + "learning_rate": 7.435768261964736e-08, + "logits/chosen": -2.7953238487243652, + "logits/rejected": -2.7698287963867188, + "logps/chosen": -253.69473266601562, + "logps/rejected": -218.02468872070312, + "loss": 0.6901, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.03720221668481827, + "rewards/margins": 0.011492163874208927, + "rewards/rejected": 0.025710051879286766, + "step": 5240 + }, + { + "epoch": 0.92, + "learning_rate": 7.43073047858942e-08, + "logits/chosen": -2.7610411643981934, + "logits/rejected": -2.7470200061798096, + "logps/chosen": -214.7230987548828, + "logps/rejected": -183.76800537109375, + "loss": 0.6901, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.02231210097670555, + "rewards/margins": 0.00498523935675621, + "rewards/rejected": 0.01732686348259449, + "step": 5250 + }, + { + "epoch": 0.92, + "learning_rate": 7.425692695214105e-08, + "logits/chosen": -2.7620432376861572, + "logits/rejected": -2.724316358566284, + "logps/chosen": -206.0223388671875, + "logps/rejected": -204.09695434570312, + "loss": 0.6909, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.021319400519132614, + "rewards/margins": 0.007719547487795353, + "rewards/rejected": 0.01359985489398241, + "step": 5260 + }, + { + "epoch": 0.92, + "learning_rate": 7.42065491183879e-08, + "logits/chosen": -2.7803006172180176, + "logits/rejected": -2.7820000648498535, + "logps/chosen": -175.95228576660156, + "logps/rejected": -147.31631469726562, + "loss": 0.6906, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.01864704303443432, + "rewards/margins": 0.005782184191048145, + "rewards/rejected": 0.012864859774708748, + "step": 5270 + }, + { + "epoch": 0.92, + "learning_rate": 7.415617128463476e-08, + "logits/chosen": -2.7566115856170654, + "logits/rejected": -2.7493796348571777, + "logps/chosen": -277.02899169921875, + "logps/rejected": -236.46224975585938, + "loss": 0.6905, + "rewards/accuracies": 0.800000011920929, + "rewards/chosen": 0.037890736013650894, + "rewards/margins": 0.00899316743016243, + "rewards/rejected": 0.028897572308778763, + "step": 5280 + }, + { + "epoch": 0.93, + "learning_rate": 7.41057934508816e-08, + "logits/chosen": -2.733806610107422, + "logits/rejected": -2.809513807296753, + "logps/chosen": -249.7975311279297, + "logps/rejected": -216.98861694335938, + "loss": 0.6891, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02854977548122406, + "rewards/margins": 0.007073344197124243, + "rewards/rejected": 0.021476436406373978, + "step": 5290 + }, + { + "epoch": 0.93, + "learning_rate": 7.405541561712845e-08, + "logits/chosen": -2.793487071990967, + "logits/rejected": -2.745420217514038, + "logps/chosen": -219.4196319580078, + "logps/rejected": -186.6765594482422, + "loss": 0.6899, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.023922424763441086, + "rewards/margins": 0.007303243037313223, + "rewards/rejected": 0.016619181260466576, + "step": 5300 + }, + { + "epoch": 0.93, + "learning_rate": 7.40050377833753e-08, + "logits/chosen": -2.798801898956299, + "logits/rejected": -2.8438451290130615, + "logps/chosen": -214.73941040039062, + "logps/rejected": -186.37538146972656, + "loss": 0.6908, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.02055622637271881, + "rewards/margins": 0.003379581030458212, + "rewards/rejected": 0.017176643013954163, + "step": 5310 + }, + { + "epoch": 0.93, + "learning_rate": 7.395465994962217e-08, + "logits/chosen": -2.7654082775115967, + "logits/rejected": -2.7806427478790283, + "logps/chosen": -219.7326202392578, + "logps/rejected": -204.74957275390625, + "loss": 0.6899, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.02500101923942566, + "rewards/margins": 0.0017423263052478433, + "rewards/rejected": 0.023258691653609276, + "step": 5320 + }, + { + "epoch": 0.93, + "learning_rate": 7.390428211586901e-08, + "logits/chosen": -2.636276960372925, + "logits/rejected": -2.816444158554077, + "logps/chosen": -206.4623565673828, + "logps/rejected": -154.90005493164062, + "loss": 0.6904, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.02116440422832966, + "rewards/margins": 0.004634098149836063, + "rewards/rejected": 0.01653030514717102, + "step": 5330 + }, + { + "epoch": 0.94, + "learning_rate": 7.385390428211587e-08, + "logits/chosen": -2.71712589263916, + "logits/rejected": -2.712641477584839, + "logps/chosen": -234.46609497070312, + "logps/rejected": -188.48818969726562, + "loss": 0.6926, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.020298270508646965, + "rewards/margins": 0.0009019045392051339, + "rewards/rejected": 0.01939636841416359, + "step": 5340 + }, + { + "epoch": 0.94, + "learning_rate": 7.380352644836272e-08, + "logits/chosen": -2.813690662384033, + "logits/rejected": -2.7450575828552246, + "logps/chosen": -229.24288940429688, + "logps/rejected": -251.2069549560547, + "loss": 0.6904, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.02722129225730896, + "rewards/margins": -0.0024374243803322315, + "rewards/rejected": 0.029658714309334755, + "step": 5350 + }, + { + "epoch": 0.94, + "learning_rate": 7.375314861460957e-08, + "logits/chosen": -2.7050914764404297, + "logits/rejected": -2.6738526821136475, + "logps/chosen": -209.76651000976562, + "logps/rejected": -210.8341064453125, + "loss": 0.6913, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.018942106515169144, + "rewards/margins": -0.0005925153382122517, + "rewards/rejected": 0.019534621387720108, + "step": 5360 + }, + { + "epoch": 0.94, + "learning_rate": 7.370277078085641e-08, + "logits/chosen": -2.723813533782959, + "logits/rejected": -2.7255825996398926, + "logps/chosen": -245.219482421875, + "logps/rejected": -260.9398498535156, + "loss": 0.6912, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.02663588896393776, + "rewards/margins": -0.0023054510820657015, + "rewards/rejected": 0.02894134260714054, + "step": 5370 + }, + { + "epoch": 0.94, + "learning_rate": 7.365239294710327e-08, + "logits/chosen": -2.768441677093506, + "logits/rejected": -2.7272372245788574, + "logps/chosen": -226.75308227539062, + "logps/rejected": -202.91358947753906, + "loss": 0.6912, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.026924926787614822, + "rewards/margins": 0.00796701293438673, + "rewards/rejected": 0.018957912921905518, + "step": 5380 + }, + { + "epoch": 0.94, + "learning_rate": 7.360201511335012e-08, + "logits/chosen": -2.7350900173187256, + "logits/rejected": -2.7533819675445557, + "logps/chosen": -191.90249633789062, + "logps/rejected": -169.1590118408203, + "loss": 0.6904, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.018432730808854103, + "rewards/margins": 0.006261094473302364, + "rewards/rejected": 0.012171637266874313, + "step": 5390 + }, + { + "epoch": 0.95, + "learning_rate": 7.355163727959698e-08, + "logits/chosen": -2.700066089630127, + "logits/rejected": -2.7570040225982666, + "logps/chosen": -263.6595153808594, + "logps/rejected": -196.6237335205078, + "loss": 0.6895, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.030814606696367264, + "rewards/margins": 0.012204675003886223, + "rewards/rejected": 0.01860993169248104, + "step": 5400 + }, + { + "epoch": 0.95, + "learning_rate": 7.350125944584382e-08, + "logits/chosen": -2.8282995223999023, + "logits/rejected": -2.7629384994506836, + "logps/chosen": -218.19076538085938, + "logps/rejected": -225.69961547851562, + "loss": 0.6907, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.025148767977952957, + "rewards/margins": 0.0035461492370814085, + "rewards/rejected": 0.02160261943936348, + "step": 5410 + }, + { + "epoch": 0.95, + "learning_rate": 7.345088161209067e-08, + "logits/chosen": -2.7315096855163574, + "logits/rejected": -2.767759323120117, + "logps/chosen": -221.05850219726562, + "logps/rejected": -205.8386688232422, + "loss": 0.6912, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.025065699592232704, + "rewards/margins": 0.004063331056386232, + "rewards/rejected": 0.02100237086415291, + "step": 5420 + }, + { + "epoch": 0.95, + "learning_rate": 7.340050377833754e-08, + "logits/chosen": -2.754154682159424, + "logits/rejected": -2.780801296234131, + "logps/chosen": -197.50173950195312, + "logps/rejected": -179.8265380859375, + "loss": 0.6907, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.02420850098133087, + "rewards/margins": 0.010105123743414879, + "rewards/rejected": 0.014103377237915993, + "step": 5430 + }, + { + "epoch": 0.95, + "learning_rate": 7.335012594458439e-08, + "logits/chosen": -2.699470043182373, + "logits/rejected": -2.740807294845581, + "logps/chosen": -234.15097045898438, + "logps/rejected": -194.5983428955078, + "loss": 0.6902, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.02444395422935486, + "rewards/margins": 0.007107601501047611, + "rewards/rejected": 0.017336349934339523, + "step": 5440 + }, + { + "epoch": 0.95, + "learning_rate": 7.329974811083123e-08, + "logits/chosen": -2.7896604537963867, + "logits/rejected": -2.846015214920044, + "logps/chosen": -242.762939453125, + "logps/rejected": -184.61318969726562, + "loss": 0.6902, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.02861708402633667, + "rewards/margins": 0.012237682938575745, + "rewards/rejected": 0.016379402950406075, + "step": 5450 + }, + { + "epoch": 0.96, + "learning_rate": 7.324937027707808e-08, + "logits/chosen": -2.7799696922302246, + "logits/rejected": -2.8197786808013916, + "logps/chosen": -238.2605743408203, + "logps/rejected": -217.13143920898438, + "loss": 0.6904, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.02993357554078102, + "rewards/margins": 0.008179426193237305, + "rewards/rejected": 0.021754145622253418, + "step": 5460 + }, + { + "epoch": 0.96, + "learning_rate": 7.319899244332494e-08, + "logits/chosen": -2.792241096496582, + "logits/rejected": -2.817352294921875, + "logps/chosen": -229.5667266845703, + "logps/rejected": -233.867431640625, + "loss": 0.6899, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.028801094740629196, + "rewards/margins": 0.0033335580956190825, + "rewards/rejected": 0.025467539206147194, + "step": 5470 + }, + { + "epoch": 0.96, + "learning_rate": 7.314861460957179e-08, + "logits/chosen": -2.7579219341278076, + "logits/rejected": -2.7147867679595947, + "logps/chosen": -258.652587890625, + "logps/rejected": -257.3244934082031, + "loss": 0.6907, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.02721872553229332, + "rewards/margins": 0.00041804014472290874, + "rewards/rejected": 0.02680068649351597, + "step": 5480 + }, + { + "epoch": 0.96, + "learning_rate": 7.309823677581863e-08, + "logits/chosen": -2.8154964447021484, + "logits/rejected": -2.8179690837860107, + "logps/chosen": -223.1553192138672, + "logps/rejected": -172.56883239746094, + "loss": 0.6907, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.025681037455797195, + "rewards/margins": 0.011194641701877117, + "rewards/rejected": 0.014486396685242653, + "step": 5490 + }, + { + "epoch": 0.96, + "learning_rate": 7.304785894206549e-08, + "logits/chosen": -2.7281696796417236, + "logits/rejected": -2.7027804851531982, + "logps/chosen": -190.97433471679688, + "logps/rejected": -182.0121307373047, + "loss": 0.6895, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.023420389741659164, + "rewards/margins": 0.006670433096587658, + "rewards/rejected": 0.01674995757639408, + "step": 5500 + }, + { + "epoch": 0.97, + "learning_rate": 7.299748110831234e-08, + "logits/chosen": -2.6794257164001465, + "logits/rejected": -2.696403980255127, + "logps/chosen": -214.8280029296875, + "logps/rejected": -171.09063720703125, + "loss": 0.6898, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.026057744398713112, + "rewards/margins": 0.010476592928171158, + "rewards/rejected": 0.015581147745251656, + "step": 5510 + }, + { + "epoch": 0.97, + "learning_rate": 7.294710327455918e-08, + "logits/chosen": -2.7246193885803223, + "logits/rejected": -2.7311501502990723, + "logps/chosen": -266.88446044921875, + "logps/rejected": -221.1366424560547, + "loss": 0.6903, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.028967270627617836, + "rewards/margins": 0.006662419531494379, + "rewards/rejected": 0.022304847836494446, + "step": 5520 + }, + { + "epoch": 0.97, + "learning_rate": 7.289672544080603e-08, + "logits/chosen": -2.7876334190368652, + "logits/rejected": -2.8115463256835938, + "logps/chosen": -240.1504669189453, + "logps/rejected": -210.5426788330078, + "loss": 0.69, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.027545759454369545, + "rewards/margins": 0.009936556220054626, + "rewards/rejected": 0.01760920323431492, + "step": 5530 + }, + { + "epoch": 0.97, + "learning_rate": 7.28463476070529e-08, + "logits/chosen": -2.799808979034424, + "logits/rejected": -2.8136532306671143, + "logps/chosen": -222.64321899414062, + "logps/rejected": -197.42601013183594, + "loss": 0.6918, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.021958649158477783, + "rewards/margins": -0.0008252925472334027, + "rewards/rejected": 0.02278394252061844, + "step": 5540 + }, + { + "epoch": 0.97, + "learning_rate": 7.279596977329975e-08, + "logits/chosen": -2.6864452362060547, + "logits/rejected": -2.707339286804199, + "logps/chosen": -233.6274871826172, + "logps/rejected": -208.48046875, + "loss": 0.6901, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03295878320932388, + "rewards/margins": 0.011183591559529305, + "rewards/rejected": 0.021775193512439728, + "step": 5550 + }, + { + "epoch": 0.97, + "learning_rate": 7.27455919395466e-08, + "logits/chosen": -2.8088607788085938, + "logits/rejected": -2.825002431869507, + "logps/chosen": -218.2990264892578, + "logps/rejected": -191.56271362304688, + "loss": 0.6911, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.02727615274488926, + "rewards/margins": 0.0035555907525122166, + "rewards/rejected": 0.02372056432068348, + "step": 5560 + }, + { + "epoch": 0.98, + "learning_rate": 7.269521410579345e-08, + "logits/chosen": -2.7786643505096436, + "logits/rejected": -2.771984100341797, + "logps/chosen": -216.9097442626953, + "logps/rejected": -186.2939910888672, + "loss": 0.6897, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.023232027888298035, + "rewards/margins": 0.009016161784529686, + "rewards/rejected": 0.014215867035090923, + "step": 5570 + }, + { + "epoch": 0.98, + "learning_rate": 7.26448362720403e-08, + "logits/chosen": -2.739405393600464, + "logits/rejected": -2.7287230491638184, + "logps/chosen": -203.91127014160156, + "logps/rejected": -170.11453247070312, + "loss": 0.6909, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.020928533747792244, + "rewards/margins": 0.00953659974038601, + "rewards/rejected": 0.011391934007406235, + "step": 5580 + }, + { + "epoch": 0.98, + "learning_rate": 7.259445843828716e-08, + "logits/chosen": -2.740872383117676, + "logits/rejected": -2.7223007678985596, + "logps/chosen": -233.0533905029297, + "logps/rejected": -194.1956024169922, + "loss": 0.6897, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.030118608847260475, + "rewards/margins": 0.010699293576180935, + "rewards/rejected": 0.019419312477111816, + "step": 5590 + }, + { + "epoch": 0.98, + "learning_rate": 7.2544080604534e-08, + "logits/chosen": -2.7146565914154053, + "logits/rejected": -2.750152349472046, + "logps/chosen": -256.93853759765625, + "logps/rejected": -221.79159545898438, + "loss": 0.6904, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.02939864620566368, + "rewards/margins": 0.0112245362251997, + "rewards/rejected": 0.01817411556839943, + "step": 5600 + }, + { + "epoch": 0.98, + "learning_rate": 7.249370277078085e-08, + "logits/chosen": -2.8190269470214844, + "logits/rejected": -2.767198085784912, + "logps/chosen": -229.6221923828125, + "logps/rejected": -172.2571258544922, + "loss": 0.6898, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.028731968253850937, + "rewards/margins": 0.008819608017802238, + "rewards/rejected": 0.019912362098693848, + "step": 5610 + }, + { + "epoch": 0.98, + "learning_rate": 7.24433249370277e-08, + "logits/chosen": -2.7028396129608154, + "logits/rejected": -2.7214255332946777, + "logps/chosen": -250.2680206298828, + "logps/rejected": -220.27035522460938, + "loss": 0.6902, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.025800978764891624, + "rewards/margins": 0.005141588859260082, + "rewards/rejected": 0.02065938711166382, + "step": 5620 + }, + { + "epoch": 0.99, + "learning_rate": 7.239294710327456e-08, + "logits/chosen": -2.701507806777954, + "logits/rejected": -2.7152953147888184, + "logps/chosen": -232.4032745361328, + "logps/rejected": -196.23092651367188, + "loss": 0.6896, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.02751338854432106, + "rewards/margins": 0.009677217341959476, + "rewards/rejected": 0.01783617213368416, + "step": 5630 + }, + { + "epoch": 0.99, + "learning_rate": 7.23425692695214e-08, + "logits/chosen": -2.7169084548950195, + "logits/rejected": -2.7731575965881348, + "logps/chosen": -185.28652954101562, + "logps/rejected": -152.3063507080078, + "loss": 0.6894, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.019060537219047546, + "rewards/margins": 0.005134892649948597, + "rewards/rejected": 0.01392564456909895, + "step": 5640 + }, + { + "epoch": 0.99, + "learning_rate": 7.229219143576826e-08, + "logits/chosen": -2.6719276905059814, + "logits/rejected": -2.738537549972534, + "logps/chosen": -235.8744354248047, + "logps/rejected": -199.79006958007812, + "loss": 0.6906, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.020635856315493584, + "rewards/margins": 0.0033695294987410307, + "rewards/rejected": 0.017266323789954185, + "step": 5650 + }, + { + "epoch": 0.99, + "learning_rate": 7.224181360201512e-08, + "logits/chosen": -2.7093288898468018, + "logits/rejected": -2.734323740005493, + "logps/chosen": -250.06448364257812, + "logps/rejected": -218.0438995361328, + "loss": 0.6891, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03046129085123539, + "rewards/margins": 0.009602924808859825, + "rewards/rejected": 0.020858367905020714, + "step": 5660 + }, + { + "epoch": 0.99, + "learning_rate": 7.219143576826197e-08, + "logits/chosen": -2.734480381011963, + "logits/rejected": -2.7367444038391113, + "logps/chosen": -229.1237030029297, + "logps/rejected": -193.18789672851562, + "loss": 0.6905, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.030041057616472244, + "rewards/margins": 0.01030112337321043, + "rewards/rejected": 0.01973992958664894, + "step": 5670 + }, + { + "epoch": 0.99, + "learning_rate": 7.214105793450881e-08, + "logits/chosen": -2.8194003105163574, + "logits/rejected": -2.806227922439575, + "logps/chosen": -236.7169647216797, + "logps/rejected": -207.375244140625, + "loss": 0.6903, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03411722555756569, + "rewards/margins": 0.006585100200027227, + "rewards/rejected": 0.027532124891877174, + "step": 5680 + }, + { + "epoch": 1.0, + "learning_rate": 7.209068010075566e-08, + "logits/chosen": -2.7609643936157227, + "logits/rejected": -2.717151165008545, + "logps/chosen": -202.71209716796875, + "logps/rejected": -206.85635375976562, + "loss": 0.6906, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.021368782967329025, + "rewards/margins": 0.0015123977791517973, + "rewards/rejected": 0.01985638588666916, + "step": 5690 + }, + { + "epoch": 1.0, + "learning_rate": 7.204030226700252e-08, + "logits/chosen": -2.7241241931915283, + "logits/rejected": -2.7976861000061035, + "logps/chosen": -214.01611328125, + "logps/rejected": -226.95248413085938, + "loss": 0.6895, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.02871261164546013, + "rewards/margins": 0.0027239874470978975, + "rewards/rejected": 0.025988629087805748, + "step": 5700 + }, + { + "epoch": 1.0, + "learning_rate": 7.198992443324937e-08, + "logits/chosen": -2.7344629764556885, + "logits/rejected": -2.7737178802490234, + "logps/chosen": -182.60733032226562, + "logps/rejected": -152.49124145507812, + "loss": 0.6898, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.017043083906173706, + "rewards/margins": 0.007706266827881336, + "rewards/rejected": 0.00933681707829237, + "step": 5710 + }, + { + "epoch": 1.0, + "learning_rate": 7.193954659949621e-08, + "logits/chosen": -2.763538360595703, + "logits/rejected": -2.748915195465088, + "logps/chosen": -231.2855224609375, + "logps/rejected": -191.68783569335938, + "loss": 0.6902, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.025866854935884476, + "rewards/margins": 0.006101249251514673, + "rewards/rejected": 0.01976560428738594, + "step": 5720 + }, + { + "epoch": 1.0, + "learning_rate": 7.188916876574307e-08, + "logits/chosen": -2.7810988426208496, + "logits/rejected": -2.7703845500946045, + "logps/chosen": -244.68374633789062, + "logps/rejected": -209.5547637939453, + "loss": 0.6905, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02857055887579918, + "rewards/margins": 0.007741375360637903, + "rewards/rejected": 0.020829183980822563, + "step": 5730 + }, + { + "epoch": 1.01, + "learning_rate": 7.183879093198992e-08, + "logits/chosen": -2.7122907638549805, + "logits/rejected": -2.73596453666687, + "logps/chosen": -255.967041015625, + "logps/rejected": -266.4009094238281, + "loss": 0.6912, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.028105050325393677, + "rewards/margins": -0.008025139570236206, + "rewards/rejected": 0.03613018989562988, + "step": 5740 + }, + { + "epoch": 1.01, + "learning_rate": 7.178841309823677e-08, + "logits/chosen": -2.866520404815674, + "logits/rejected": -2.8223705291748047, + "logps/chosen": -247.6078643798828, + "logps/rejected": -226.6530303955078, + "loss": 0.6899, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.03066597506403923, + "rewards/margins": 0.0038692415691912174, + "rewards/rejected": 0.0267967339605093, + "step": 5750 + }, + { + "epoch": 1.01, + "learning_rate": 7.173803526448363e-08, + "logits/chosen": -2.6920933723449707, + "logits/rejected": -2.7121245861053467, + "logps/chosen": -215.04800415039062, + "logps/rejected": -174.98876953125, + "loss": 0.6894, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.02779332920908928, + "rewards/margins": 0.01028980128467083, + "rewards/rejected": 0.0175035297870636, + "step": 5760 + }, + { + "epoch": 1.01, + "learning_rate": 7.168765743073048e-08, + "logits/chosen": -2.8041000366210938, + "logits/rejected": -2.824524164199829, + "logps/chosen": -218.9689483642578, + "logps/rejected": -179.63414001464844, + "loss": 0.6899, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03265921026468277, + "rewards/margins": 0.011257478967308998, + "rewards/rejected": 0.02140173129737377, + "step": 5770 + }, + { + "epoch": 1.01, + "learning_rate": 7.163727959697733e-08, + "logits/chosen": -2.758688449859619, + "logits/rejected": -2.7820353507995605, + "logps/chosen": -208.04373168945312, + "logps/rejected": -205.10140991210938, + "loss": 0.6901, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.02206188254058361, + "rewards/margins": -0.00437159975990653, + "rewards/rejected": 0.026433482766151428, + "step": 5780 + }, + { + "epoch": 1.01, + "learning_rate": 7.158690176322419e-08, + "logits/chosen": -2.7041327953338623, + "logits/rejected": -2.728461503982544, + "logps/chosen": -280.71221923828125, + "logps/rejected": -219.6815643310547, + "loss": 0.689, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.03200947865843773, + "rewards/margins": 0.012490824796259403, + "rewards/rejected": 0.019518649205565453, + "step": 5790 + }, + { + "epoch": 1.02, + "learning_rate": 7.153652392947103e-08, + "logits/chosen": -2.7607803344726562, + "logits/rejected": -2.7257144451141357, + "logps/chosen": -190.4318084716797, + "logps/rejected": -195.79026794433594, + "loss": 0.6905, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.02486034855246544, + "rewards/margins": 0.004990352317690849, + "rewards/rejected": 0.01986999623477459, + "step": 5800 + }, + { + "epoch": 1.02, + "learning_rate": 7.148614609571788e-08, + "logits/chosen": -2.792731761932373, + "logits/rejected": -2.72947096824646, + "logps/chosen": -285.7711486816406, + "logps/rejected": -224.35043334960938, + "loss": 0.6903, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": 0.038356930017471313, + "rewards/margins": 0.013529865071177483, + "rewards/rejected": 0.02482706308364868, + "step": 5810 + }, + { + "epoch": 1.02, + "learning_rate": 7.143576826196474e-08, + "logits/chosen": -2.727290630340576, + "logits/rejected": -2.7715020179748535, + "logps/chosen": -213.47970581054688, + "logps/rejected": -171.37945556640625, + "loss": 0.6895, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.029690707102417946, + "rewards/margins": 0.009509574621915817, + "rewards/rejected": 0.02018113061785698, + "step": 5820 + }, + { + "epoch": 1.02, + "learning_rate": 7.138539042821158e-08, + "logits/chosen": -2.8073341846466064, + "logits/rejected": -2.7381162643432617, + "logps/chosen": -247.31967163085938, + "logps/rejected": -208.36679077148438, + "loss": 0.6895, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.026355374604463577, + "rewards/margins": 0.008763824589550495, + "rewards/rejected": 0.017591550946235657, + "step": 5830 + }, + { + "epoch": 1.02, + "learning_rate": 7.133501259445843e-08, + "logits/chosen": -2.730480670928955, + "logits/rejected": -2.8047595024108887, + "logps/chosen": -233.4124298095703, + "logps/rejected": -195.85726928710938, + "loss": 0.6887, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.03406389430165291, + "rewards/margins": 0.012370677664875984, + "rewards/rejected": 0.021693218499422073, + "step": 5840 + }, + { + "epoch": 1.02, + "learning_rate": 7.128463476070528e-08, + "logits/chosen": -2.808271884918213, + "logits/rejected": -2.814162015914917, + "logps/chosen": -236.5506134033203, + "logps/rejected": -254.416748046875, + "loss": 0.6909, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.034293659031391144, + "rewards/margins": -0.00255168997682631, + "rewards/rejected": 0.03684535250067711, + "step": 5850 + }, + { + "epoch": 1.03, + "learning_rate": 7.123425692695214e-08, + "logits/chosen": -2.7728164196014404, + "logits/rejected": -2.8868014812469482, + "logps/chosen": -273.46490478515625, + "logps/rejected": -276.16217041015625, + "loss": 0.6904, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.032950371503829956, + "rewards/margins": -0.0058128563687205315, + "rewards/rejected": 0.038763221353292465, + "step": 5860 + }, + { + "epoch": 1.03, + "learning_rate": 7.118387909319899e-08, + "logits/chosen": -2.7602274417877197, + "logits/rejected": -2.7588744163513184, + "logps/chosen": -227.1925048828125, + "logps/rejected": -201.4271240234375, + "loss": 0.69, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.027265915647149086, + "rewards/margins": 0.004671896807849407, + "rewards/rejected": 0.022594016045331955, + "step": 5870 + }, + { + "epoch": 1.03, + "learning_rate": 7.113350125944584e-08, + "logits/chosen": -2.844517230987549, + "logits/rejected": -2.8165762424468994, + "logps/chosen": -264.95025634765625, + "logps/rejected": -215.6854705810547, + "loss": 0.6902, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03531178832054138, + "rewards/margins": 0.013238337822258472, + "rewards/rejected": 0.022073451429605484, + "step": 5880 + }, + { + "epoch": 1.03, + "learning_rate": 7.10831234256927e-08, + "logits/chosen": -2.6709351539611816, + "logits/rejected": -2.7894115447998047, + "logps/chosen": -224.2041473388672, + "logps/rejected": -195.13259887695312, + "loss": 0.6913, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.030605291947722435, + "rewards/margins": 0.006223782896995544, + "rewards/rejected": 0.02438150718808174, + "step": 5890 + }, + { + "epoch": 1.03, + "learning_rate": 7.103274559193955e-08, + "logits/chosen": -2.7667765617370605, + "logits/rejected": -2.8099000453948975, + "logps/chosen": -275.52734375, + "logps/rejected": -254.30813598632812, + "loss": 0.6897, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03211339935660362, + "rewards/margins": 0.007406218443065882, + "rewards/rejected": 0.02470717951655388, + "step": 5900 + }, + { + "epoch": 1.04, + "learning_rate": 7.098236775818639e-08, + "logits/chosen": -2.7795968055725098, + "logits/rejected": -2.7805514335632324, + "logps/chosen": -233.39816284179688, + "logps/rejected": -226.5900115966797, + "loss": 0.6904, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.032585471868515015, + "rewards/margins": 0.0037678040098398924, + "rewards/rejected": 0.02881767228245735, + "step": 5910 + }, + { + "epoch": 1.04, + "learning_rate": 7.093198992443325e-08, + "logits/chosen": -2.794847249984741, + "logits/rejected": -2.7636165618896484, + "logps/chosen": -205.1078338623047, + "logps/rejected": -182.61715698242188, + "loss": 0.6898, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.030280139297246933, + "rewards/margins": 0.009688856080174446, + "rewards/rejected": 0.020591281354427338, + "step": 5920 + }, + { + "epoch": 1.04, + "learning_rate": 7.08816120906801e-08, + "logits/chosen": -2.6991028785705566, + "logits/rejected": -2.7790234088897705, + "logps/chosen": -191.94183349609375, + "logps/rejected": -199.76925659179688, + "loss": 0.691, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.023268550634384155, + "rewards/margins": -0.0027100746519863605, + "rewards/rejected": 0.02597862482070923, + "step": 5930 + }, + { + "epoch": 1.04, + "learning_rate": 7.083123425692695e-08, + "logits/chosen": -2.7407565116882324, + "logits/rejected": -2.7216477394104004, + "logps/chosen": -215.4610595703125, + "logps/rejected": -210.43701171875, + "loss": 0.691, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.027795767411589622, + "rewards/margins": 0.008198624476790428, + "rewards/rejected": 0.019597141072154045, + "step": 5940 + }, + { + "epoch": 1.04, + "learning_rate": 7.078085642317379e-08, + "logits/chosen": -2.7855286598205566, + "logits/rejected": -2.8717663288116455, + "logps/chosen": -264.8656005859375, + "logps/rejected": -259.3266906738281, + "loss": 0.6915, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03862554579973221, + "rewards/margins": 0.004008482210338116, + "rewards/rejected": 0.03461706265807152, + "step": 5950 + }, + { + "epoch": 1.04, + "learning_rate": 7.073047858942065e-08, + "logits/chosen": -2.6747562885284424, + "logits/rejected": -2.7460849285125732, + "logps/chosen": -285.8426513671875, + "logps/rejected": -243.5648193359375, + "loss": 0.6901, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.04209999367594719, + "rewards/margins": 0.006486804690212011, + "rewards/rejected": 0.03561318665742874, + "step": 5960 + }, + { + "epoch": 1.05, + "learning_rate": 7.06801007556675e-08, + "logits/chosen": -2.763223171234131, + "logits/rejected": -2.7372517585754395, + "logps/chosen": -245.48654174804688, + "logps/rejected": -239.01199340820312, + "loss": 0.6895, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03261946514248848, + "rewards/margins": 0.009107634425163269, + "rewards/rejected": 0.02351183071732521, + "step": 5970 + }, + { + "epoch": 1.05, + "learning_rate": 7.062972292191435e-08, + "logits/chosen": -2.7299296855926514, + "logits/rejected": -2.765787363052368, + "logps/chosen": -198.8389129638672, + "logps/rejected": -203.43792724609375, + "loss": 0.6911, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.02900700271129608, + "rewards/margins": 0.0003943299816455692, + "rewards/rejected": 0.028612669557332993, + "step": 5980 + }, + { + "epoch": 1.05, + "learning_rate": 7.057934508816121e-08, + "logits/chosen": -2.7050979137420654, + "logits/rejected": -2.739762544631958, + "logps/chosen": -308.5540466308594, + "logps/rejected": -277.5274658203125, + "loss": 0.6896, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03356204554438591, + "rewards/margins": 0.0038282524328678846, + "rewards/rejected": 0.029733791947364807, + "step": 5990 + }, + { + "epoch": 1.05, + "learning_rate": 7.052896725440806e-08, + "logits/chosen": -2.6613450050354004, + "logits/rejected": -2.6997017860412598, + "logps/chosen": -219.81979370117188, + "logps/rejected": -204.18075561523438, + "loss": 0.6898, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.029529878869652748, + "rewards/margins": 0.0035093098413199186, + "rewards/rejected": 0.02602056786417961, + "step": 6000 + }, + { + "epoch": 1.05, + "learning_rate": 7.047858942065492e-08, + "logits/chosen": -2.6856908798217773, + "logits/rejected": -2.740572452545166, + "logps/chosen": -281.0226135253906, + "logps/rejected": -247.1945037841797, + "loss": 0.6903, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03560008853673935, + "rewards/margins": 0.007806276436895132, + "rewards/rejected": 0.02779381349682808, + "step": 6010 + }, + { + "epoch": 1.05, + "learning_rate": 7.042821158690177e-08, + "logits/chosen": -2.833984851837158, + "logits/rejected": -2.7636830806732178, + "logps/chosen": -253.18115234375, + "logps/rejected": -197.1452178955078, + "loss": 0.6892, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03183367848396301, + "rewards/margins": 0.0074056894518435, + "rewards/rejected": 0.0244279894977808, + "step": 6020 + }, + { + "epoch": 1.06, + "learning_rate": 7.037783375314861e-08, + "logits/chosen": -2.7777915000915527, + "logits/rejected": -2.8554296493530273, + "logps/chosen": -242.44552612304688, + "logps/rejected": -209.59677124023438, + "loss": 0.6903, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.03452635556459427, + "rewards/margins": 0.002237586071714759, + "rewards/rejected": 0.03228876739740372, + "step": 6030 + }, + { + "epoch": 1.06, + "learning_rate": 7.032745591939546e-08, + "logits/chosen": -2.7216124534606934, + "logits/rejected": -2.7077813148498535, + "logps/chosen": -227.49072265625, + "logps/rejected": -183.86502075195312, + "loss": 0.6903, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.0319247804582119, + "rewards/margins": 0.00687766820192337, + "rewards/rejected": 0.025047114118933678, + "step": 6040 + }, + { + "epoch": 1.06, + "learning_rate": 7.027707808564232e-08, + "logits/chosen": -2.730086088180542, + "logits/rejected": -2.7649378776550293, + "logps/chosen": -238.0532989501953, + "logps/rejected": -194.22817993164062, + "loss": 0.6897, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.029018903151154518, + "rewards/margins": 0.002032119780778885, + "rewards/rejected": 0.026986781507730484, + "step": 6050 + }, + { + "epoch": 1.06, + "learning_rate": 7.022670025188917e-08, + "logits/chosen": -2.7800655364990234, + "logits/rejected": -2.7575435638427734, + "logps/chosen": -224.218017578125, + "logps/rejected": -186.80465698242188, + "loss": 0.69, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.029716094955801964, + "rewards/margins": 0.0046003833413124084, + "rewards/rejected": 0.025115709751844406, + "step": 6060 + }, + { + "epoch": 1.06, + "learning_rate": 7.017632241813601e-08, + "logits/chosen": -2.7532472610473633, + "logits/rejected": -2.775247573852539, + "logps/chosen": -232.7293701171875, + "logps/rejected": -259.34393310546875, + "loss": 0.69, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.033128730952739716, + "rewards/margins": -0.0032485132105648518, + "rewards/rejected": 0.03637724369764328, + "step": 6070 + }, + { + "epoch": 1.06, + "learning_rate": 7.012594458438286e-08, + "logits/chosen": -2.722989559173584, + "logits/rejected": -2.778897285461426, + "logps/chosen": -227.8129119873047, + "logps/rejected": -208.2938232421875, + "loss": 0.6896, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.028836023062467575, + "rewards/margins": 0.0021686807740479708, + "rewards/rejected": 0.026667345315217972, + "step": 6080 + }, + { + "epoch": 1.07, + "learning_rate": 7.007556675062972e-08, + "logits/chosen": -2.8650097846984863, + "logits/rejected": -2.8455333709716797, + "logps/chosen": -229.21517944335938, + "logps/rejected": -196.00250244140625, + "loss": 0.6896, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.032781932502985, + "rewards/margins": 0.013185905292630196, + "rewards/rejected": 0.019596025347709656, + "step": 6090 + }, + { + "epoch": 1.07, + "learning_rate": 7.002518891687657e-08, + "logits/chosen": -2.674905300140381, + "logits/rejected": -2.693514585494995, + "logps/chosen": -216.5654754638672, + "logps/rejected": -172.6519012451172, + "loss": 0.6906, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.02908332273364067, + "rewards/margins": 0.004312724806368351, + "rewards/rejected": 0.024770598858594894, + "step": 6100 + }, + { + "epoch": 1.07, + "learning_rate": 6.997481108312342e-08, + "logits/chosen": -2.792025566101074, + "logits/rejected": -2.8154520988464355, + "logps/chosen": -285.5600280761719, + "logps/rejected": -229.28829956054688, + "loss": 0.6898, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.034517981112003326, + "rewards/margins": 0.0033892481587827206, + "rewards/rejected": 0.03112873062491417, + "step": 6110 + }, + { + "epoch": 1.07, + "learning_rate": 6.992443324937028e-08, + "logits/chosen": -2.7616074085235596, + "logits/rejected": -2.837329864501953, + "logps/chosen": -221.0269317626953, + "logps/rejected": -172.927978515625, + "loss": 0.6897, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.028237927705049515, + "rewards/margins": 0.00989912636578083, + "rewards/rejected": 0.018338803201913834, + "step": 6120 + }, + { + "epoch": 1.07, + "learning_rate": 6.987405541561713e-08, + "logits/chosen": -2.712308168411255, + "logits/rejected": -2.7479236125946045, + "logps/chosen": -242.038818359375, + "logps/rejected": -203.10403442382812, + "loss": 0.6898, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.032026901841163635, + "rewards/margins": 0.007596462965011597, + "rewards/rejected": 0.02443043515086174, + "step": 6130 + }, + { + "epoch": 1.08, + "learning_rate": 6.982367758186397e-08, + "logits/chosen": -2.7296433448791504, + "logits/rejected": -2.7758820056915283, + "logps/chosen": -241.84091186523438, + "logps/rejected": -200.144287109375, + "loss": 0.6892, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03152359649538994, + "rewards/margins": 0.009202331304550171, + "rewards/rejected": 0.022321265190839767, + "step": 6140 + }, + { + "epoch": 1.08, + "learning_rate": 6.977329974811083e-08, + "logits/chosen": -2.761535406112671, + "logits/rejected": -2.720188856124878, + "logps/chosen": -230.50210571289062, + "logps/rejected": -198.60598754882812, + "loss": 0.6898, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.028255242854356766, + "rewards/margins": 0.002794310450553894, + "rewards/rejected": 0.025460928678512573, + "step": 6150 + }, + { + "epoch": 1.08, + "learning_rate": 6.972292191435768e-08, + "logits/chosen": -2.8285574913024902, + "logits/rejected": -2.7832274436950684, + "logps/chosen": -254.6967315673828, + "logps/rejected": -234.7633056640625, + "loss": 0.6903, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03328879922628403, + "rewards/margins": 0.005169660784304142, + "rewards/rejected": 0.028119131922721863, + "step": 6160 + }, + { + "epoch": 1.08, + "learning_rate": 6.967254408060453e-08, + "logits/chosen": -2.7056522369384766, + "logits/rejected": -2.7208755016326904, + "logps/chosen": -209.24563598632812, + "logps/rejected": -197.8179473876953, + "loss": 0.6898, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.02616763673722744, + "rewards/margins": 0.004211708437651396, + "rewards/rejected": 0.021955927833914757, + "step": 6170 + }, + { + "epoch": 1.08, + "learning_rate": 6.962216624685137e-08, + "logits/chosen": -2.662492275238037, + "logits/rejected": -2.671931028366089, + "logps/chosen": -261.2315979003906, + "logps/rejected": -233.17416381835938, + "loss": 0.6897, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.03277582675218582, + "rewards/margins": 0.004679680801928043, + "rewards/rejected": 0.02809615060687065, + "step": 6180 + }, + { + "epoch": 1.08, + "learning_rate": 6.957178841309823e-08, + "logits/chosen": -2.707197427749634, + "logits/rejected": -2.730229616165161, + "logps/chosen": -252.9608154296875, + "logps/rejected": -213.77774047851562, + "loss": 0.6906, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.036902423948049545, + "rewards/margins": 0.009274457581341267, + "rewards/rejected": 0.027627963572740555, + "step": 6190 + }, + { + "epoch": 1.09, + "learning_rate": 6.952141057934508e-08, + "logits/chosen": -2.769176959991455, + "logits/rejected": -2.7323288917541504, + "logps/chosen": -218.0635986328125, + "logps/rejected": -207.66445922851562, + "loss": 0.6892, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.026653211563825607, + "rewards/margins": 0.00453142449259758, + "rewards/rejected": 0.022121790796518326, + "step": 6200 + }, + { + "epoch": 1.09, + "learning_rate": 6.947103274559193e-08, + "logits/chosen": -2.806384325027466, + "logits/rejected": -2.756983518600464, + "logps/chosen": -237.72232055664062, + "logps/rejected": -252.24459838867188, + "loss": 0.6915, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.03373720124363899, + "rewards/margins": -0.0009608466061763465, + "rewards/rejected": 0.03469805419445038, + "step": 6210 + }, + { + "epoch": 1.09, + "learning_rate": 6.942065491183879e-08, + "logits/chosen": -2.7189059257507324, + "logits/rejected": -2.69968843460083, + "logps/chosen": -186.25367736816406, + "logps/rejected": -182.58639526367188, + "loss": 0.6907, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.02435891702771187, + "rewards/margins": 0.0031697209924459457, + "rewards/rejected": 0.021189197897911072, + "step": 6220 + }, + { + "epoch": 1.09, + "learning_rate": 6.937027707808564e-08, + "logits/chosen": -2.82783579826355, + "logits/rejected": -2.7836272716522217, + "logps/chosen": -247.9126739501953, + "logps/rejected": -207.5823974609375, + "loss": 0.6892, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.03497808799147606, + "rewards/margins": 0.012263385578989983, + "rewards/rejected": 0.022714700549840927, + "step": 6230 + }, + { + "epoch": 1.09, + "learning_rate": 6.93198992443325e-08, + "logits/chosen": -2.6979732513427734, + "logits/rejected": -2.7468159198760986, + "logps/chosen": -195.87741088867188, + "logps/rejected": -199.96136474609375, + "loss": 0.6895, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.027930688112974167, + "rewards/margins": -0.0017716297879815102, + "rewards/rejected": 0.0297023206949234, + "step": 6240 + }, + { + "epoch": 1.09, + "learning_rate": 6.926952141057935e-08, + "logits/chosen": -2.757378101348877, + "logits/rejected": -2.8484787940979004, + "logps/chosen": -252.18197631835938, + "logps/rejected": -213.80307006835938, + "loss": 0.6905, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.032926805317401886, + "rewards/margins": 0.007040529511868954, + "rewards/rejected": 0.025886276736855507, + "step": 6250 + }, + { + "epoch": 1.1, + "learning_rate": 6.921914357682619e-08, + "logits/chosen": -2.7444984912872314, + "logits/rejected": -2.7312824726104736, + "logps/chosen": -244.59176635742188, + "logps/rejected": -209.32861328125, + "loss": 0.6902, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03717253729701042, + "rewards/margins": 0.011591591872274876, + "rewards/rejected": 0.02558094635605812, + "step": 6260 + }, + { + "epoch": 1.1, + "learning_rate": 6.916876574307304e-08, + "logits/chosen": -2.8128814697265625, + "logits/rejected": -2.7963852882385254, + "logps/chosen": -273.450927734375, + "logps/rejected": -212.9509735107422, + "loss": 0.69, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.037680648267269135, + "rewards/margins": 0.013447249308228493, + "rewards/rejected": 0.024233397096395493, + "step": 6270 + }, + { + "epoch": 1.1, + "learning_rate": 6.91183879093199e-08, + "logits/chosen": -2.8444695472717285, + "logits/rejected": -2.833711862564087, + "logps/chosen": -237.81787109375, + "logps/rejected": -202.39505004882812, + "loss": 0.6896, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03637075051665306, + "rewards/margins": 0.012740323320031166, + "rewards/rejected": 0.023630429059267044, + "step": 6280 + }, + { + "epoch": 1.1, + "learning_rate": 6.906801007556675e-08, + "logits/chosen": -2.8796963691711426, + "logits/rejected": -2.8374648094177246, + "logps/chosen": -218.6466064453125, + "logps/rejected": -233.56826782226562, + "loss": 0.6893, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.027191419154405594, + "rewards/margins": -0.00017332080460619181, + "rewards/rejected": 0.027364740148186684, + "step": 6290 + }, + { + "epoch": 1.1, + "learning_rate": 6.901763224181359e-08, + "logits/chosen": -2.7870595455169678, + "logits/rejected": -2.726167678833008, + "logps/chosen": -234.41732788085938, + "logps/rejected": -195.29246520996094, + "loss": 0.6901, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.032856278121471405, + "rewards/margins": 0.009746129624545574, + "rewards/rejected": 0.023110145702958107, + "step": 6300 + }, + { + "epoch": 1.11, + "learning_rate": 6.896725440806044e-08, + "logits/chosen": -2.7080512046813965, + "logits/rejected": -2.6986517906188965, + "logps/chosen": -214.7272491455078, + "logps/rejected": -181.70693969726562, + "loss": 0.6897, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.028171220794320107, + "rewards/margins": 0.008141187019646168, + "rewards/rejected": 0.020030032843351364, + "step": 6310 + }, + { + "epoch": 1.11, + "learning_rate": 6.89168765743073e-08, + "logits/chosen": -2.8024163246154785, + "logits/rejected": -2.761427164077759, + "logps/chosen": -221.8937530517578, + "logps/rejected": -207.2194366455078, + "loss": 0.6912, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.02579706907272339, + "rewards/margins": 0.005380997434258461, + "rewards/rejected": 0.02041606977581978, + "step": 6320 + }, + { + "epoch": 1.11, + "learning_rate": 6.886649874055415e-08, + "logits/chosen": -2.7723660469055176, + "logits/rejected": -2.7853739261627197, + "logps/chosen": -264.2718811035156, + "logps/rejected": -234.5113067626953, + "loss": 0.6895, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03535057231783867, + "rewards/margins": 0.0035186149179935455, + "rewards/rejected": 0.03183195739984512, + "step": 6330 + }, + { + "epoch": 1.11, + "learning_rate": 6.8816120906801e-08, + "logits/chosen": -2.703395366668701, + "logits/rejected": -2.809828519821167, + "logps/chosen": -301.8238525390625, + "logps/rejected": -219.3530731201172, + "loss": 0.6898, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.0384126715362072, + "rewards/margins": 0.007866952568292618, + "rewards/rejected": 0.03054572269320488, + "step": 6340 + }, + { + "epoch": 1.11, + "learning_rate": 6.876574307304786e-08, + "logits/chosen": -2.8216795921325684, + "logits/rejected": -2.800515651702881, + "logps/chosen": -247.65792846679688, + "logps/rejected": -247.12326049804688, + "loss": 0.6906, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.03470718860626221, + "rewards/margins": 0.0031642660032957792, + "rewards/rejected": 0.03154291957616806, + "step": 6350 + }, + { + "epoch": 1.11, + "learning_rate": 6.871536523929471e-08, + "logits/chosen": -2.7862982749938965, + "logits/rejected": -2.735156297683716, + "logps/chosen": -187.41934204101562, + "logps/rejected": -175.93814086914062, + "loss": 0.6894, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02837715670466423, + "rewards/margins": 0.007649431936442852, + "rewards/rejected": 0.020727727562189102, + "step": 6360 + }, + { + "epoch": 1.12, + "learning_rate": 6.866498740554157e-08, + "logits/chosen": -2.718940258026123, + "logits/rejected": -2.647468090057373, + "logps/chosen": -211.13345336914062, + "logps/rejected": -231.8296356201172, + "loss": 0.6903, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.027587344869971275, + "rewards/margins": 0.00827721692621708, + "rewards/rejected": 0.019310127943754196, + "step": 6370 + }, + { + "epoch": 1.12, + "learning_rate": 6.861460957178841e-08, + "logits/chosen": -2.73569917678833, + "logits/rejected": -2.6965410709381104, + "logps/chosen": -213.14785766601562, + "logps/rejected": -239.1310577392578, + "loss": 0.6904, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.033782411366701126, + "rewards/margins": 0.004613696597516537, + "rewards/rejected": 0.029168713837862015, + "step": 6380 + }, + { + "epoch": 1.12, + "learning_rate": 6.856423173803526e-08, + "logits/chosen": -2.781935691833496, + "logits/rejected": -2.749058246612549, + "logps/chosen": -212.47116088867188, + "logps/rejected": -164.14442443847656, + "loss": 0.6896, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.02552088536322117, + "rewards/margins": 0.009579035453498363, + "rewards/rejected": 0.01594184711575508, + "step": 6390 + }, + { + "epoch": 1.12, + "learning_rate": 6.851385390428211e-08, + "logits/chosen": -2.7572851181030273, + "logits/rejected": -2.7509846687316895, + "logps/chosen": -216.94027709960938, + "logps/rejected": -181.42041015625, + "loss": 0.688, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.02696484699845314, + "rewards/margins": 0.009268132969737053, + "rewards/rejected": 0.017696712166070938, + "step": 6400 + }, + { + "epoch": 1.12, + "learning_rate": 6.846347607052897e-08, + "logits/chosen": -2.7396633625030518, + "logits/rejected": -2.7270400524139404, + "logps/chosen": -205.31503295898438, + "logps/rejected": -208.9713134765625, + "loss": 0.6897, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.027754198759794235, + "rewards/margins": 0.00899929367005825, + "rewards/rejected": 0.018754903227090836, + "step": 6410 + }, + { + "epoch": 1.12, + "learning_rate": 6.841309823677581e-08, + "logits/chosen": -2.7138712406158447, + "logits/rejected": -2.6797842979431152, + "logps/chosen": -195.82118225097656, + "logps/rejected": -187.37338256835938, + "loss": 0.6902, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.024918612092733383, + "rewards/margins": 0.0022410769015550613, + "rewards/rejected": 0.022677535191178322, + "step": 6420 + }, + { + "epoch": 1.13, + "learning_rate": 6.836272040302266e-08, + "logits/chosen": -2.751479387283325, + "logits/rejected": -2.7326974868774414, + "logps/chosen": -228.85043334960938, + "logps/rejected": -207.35287475585938, + "loss": 0.6904, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.033883582800626755, + "rewards/margins": 0.0020071747712790966, + "rewards/rejected": 0.03187640756368637, + "step": 6430 + }, + { + "epoch": 1.13, + "learning_rate": 6.831234256926952e-08, + "logits/chosen": -2.7368900775909424, + "logits/rejected": -2.7022595405578613, + "logps/chosen": -234.35888671875, + "logps/rejected": -216.0355682373047, + "loss": 0.6898, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03236772492527962, + "rewards/margins": 0.006880121771246195, + "rewards/rejected": 0.02548760175704956, + "step": 6440 + }, + { + "epoch": 1.13, + "learning_rate": 6.826196473551637e-08, + "logits/chosen": -2.8036484718322754, + "logits/rejected": -2.8090319633483887, + "logps/chosen": -221.8217010498047, + "logps/rejected": -197.96914672851562, + "loss": 0.6894, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.03676612302660942, + "rewards/margins": 0.00784066691994667, + "rewards/rejected": 0.0289254579693079, + "step": 6450 + }, + { + "epoch": 1.13, + "learning_rate": 6.821158690176322e-08, + "logits/chosen": -2.7491366863250732, + "logits/rejected": -2.7955727577209473, + "logps/chosen": -246.05380249023438, + "logps/rejected": -199.51351928710938, + "loss": 0.6887, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.03833184391260147, + "rewards/margins": 0.010535829700529575, + "rewards/rejected": 0.02779601886868477, + "step": 6460 + }, + { + "epoch": 1.13, + "learning_rate": 6.816120906801008e-08, + "logits/chosen": -2.7315986156463623, + "logits/rejected": -2.788578987121582, + "logps/chosen": -293.5569763183594, + "logps/rejected": -195.04043579101562, + "loss": 0.689, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.041501227766275406, + "rewards/margins": 0.01331830583512783, + "rewards/rejected": 0.028182918205857277, + "step": 6470 + }, + { + "epoch": 1.14, + "learning_rate": 6.811083123425693e-08, + "logits/chosen": -2.735344409942627, + "logits/rejected": -2.812255859375, + "logps/chosen": -218.69607543945312, + "logps/rejected": -176.1515350341797, + "loss": 0.6888, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.029728304594755173, + "rewards/margins": 0.007465772330760956, + "rewards/rejected": 0.022262532263994217, + "step": 6480 + }, + { + "epoch": 1.14, + "learning_rate": 6.806045340050377e-08, + "logits/chosen": -2.7940878868103027, + "logits/rejected": -2.7996413707733154, + "logps/chosen": -222.28524780273438, + "logps/rejected": -160.18359375, + "loss": 0.6886, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03442731127142906, + "rewards/margins": 0.01763591542840004, + "rewards/rejected": 0.01679139956831932, + "step": 6490 + }, + { + "epoch": 1.14, + "learning_rate": 6.801007556675062e-08, + "logits/chosen": -2.800783157348633, + "logits/rejected": -2.8015666007995605, + "logps/chosen": -258.265625, + "logps/rejected": -225.9890594482422, + "loss": 0.6912, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.027882227674126625, + "rewards/margins": -0.0033497277181595564, + "rewards/rejected": 0.03123195841908455, + "step": 6500 + }, + { + "epoch": 1.14, + "learning_rate": 6.795969773299748e-08, + "logits/chosen": -2.7174441814422607, + "logits/rejected": -2.72218656539917, + "logps/chosen": -224.7734832763672, + "logps/rejected": -211.9218292236328, + "loss": 0.6896, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.030056113377213478, + "rewards/margins": 0.001766999950632453, + "rewards/rejected": 0.02828911505639553, + "step": 6510 + }, + { + "epoch": 1.14, + "learning_rate": 6.790931989924433e-08, + "logits/chosen": -2.7325847148895264, + "logits/rejected": -2.677220582962036, + "logps/chosen": -209.3241729736328, + "logps/rejected": -201.1617889404297, + "loss": 0.6901, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.03640920668840408, + "rewards/margins": 0.004497000481933355, + "rewards/rejected": 0.03191220760345459, + "step": 6520 + }, + { + "epoch": 1.14, + "learning_rate": 6.785894206549117e-08, + "logits/chosen": -2.7233242988586426, + "logits/rejected": -2.754073143005371, + "logps/chosen": -261.9200439453125, + "logps/rejected": -231.17337036132812, + "loss": 0.6898, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.033219657838344574, + "rewards/margins": 0.005315340589731932, + "rewards/rejected": 0.027904313057661057, + "step": 6530 + }, + { + "epoch": 1.15, + "learning_rate": 6.780856423173803e-08, + "logits/chosen": -2.76570463180542, + "logits/rejected": -2.751070022583008, + "logps/chosen": -222.1561279296875, + "logps/rejected": -208.1566162109375, + "loss": 0.6888, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.03213818743824959, + "rewards/margins": 0.011885440908372402, + "rewards/rejected": 0.02025274559855461, + "step": 6540 + }, + { + "epoch": 1.15, + "learning_rate": 6.775818639798488e-08, + "logits/chosen": -2.7724246978759766, + "logits/rejected": -2.75826358795166, + "logps/chosen": -221.2061767578125, + "logps/rejected": -196.8527069091797, + "loss": 0.6906, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03563159704208374, + "rewards/margins": 0.00219206721521914, + "rewards/rejected": 0.03343953564763069, + "step": 6550 + }, + { + "epoch": 1.15, + "learning_rate": 6.770780856423173e-08, + "logits/chosen": -2.753361225128174, + "logits/rejected": -2.754962921142578, + "logps/chosen": -238.34725952148438, + "logps/rejected": -216.7457733154297, + "loss": 0.6886, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.036745570600032806, + "rewards/margins": 0.006122713442891836, + "rewards/rejected": 0.030622858554124832, + "step": 6560 + }, + { + "epoch": 1.15, + "learning_rate": 6.765743073047859e-08, + "logits/chosen": -2.726283550262451, + "logits/rejected": -2.680886745452881, + "logps/chosen": -244.8686065673828, + "logps/rejected": -183.89035034179688, + "loss": 0.6879, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.03608755022287369, + "rewards/margins": 0.011775456368923187, + "rewards/rejected": 0.0243120975792408, + "step": 6570 + }, + { + "epoch": 1.15, + "learning_rate": 6.760705289672544e-08, + "logits/chosen": -2.6707301139831543, + "logits/rejected": -2.8088834285736084, + "logps/chosen": -267.09796142578125, + "logps/rejected": -217.032958984375, + "loss": 0.6887, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03969926759600639, + "rewards/margins": 0.006029042415320873, + "rewards/rejected": 0.033670224249362946, + "step": 6580 + }, + { + "epoch": 1.15, + "learning_rate": 6.75566750629723e-08, + "logits/chosen": -2.808931827545166, + "logits/rejected": -2.7902331352233887, + "logps/chosen": -247.80078125, + "logps/rejected": -202.20140075683594, + "loss": 0.6901, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03151538223028183, + "rewards/margins": 0.003934096544981003, + "rewards/rejected": 0.027581283822655678, + "step": 6590 + }, + { + "epoch": 1.16, + "learning_rate": 6.750629722921915e-08, + "logits/chosen": -2.787019968032837, + "logits/rejected": -2.751845359802246, + "logps/chosen": -209.40011596679688, + "logps/rejected": -177.8138885498047, + "loss": 0.6893, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.025737786665558815, + "rewards/margins": 0.008292414247989655, + "rewards/rejected": 0.01744537055492401, + "step": 6600 + }, + { + "epoch": 1.16, + "learning_rate": 6.745591939546599e-08, + "logits/chosen": -2.734375476837158, + "logits/rejected": -2.83819842338562, + "logps/chosen": -279.52569580078125, + "logps/rejected": -200.38143920898438, + "loss": 0.689, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.045416612178087234, + "rewards/margins": 0.015584426000714302, + "rewards/rejected": 0.02983218990266323, + "step": 6610 + }, + { + "epoch": 1.16, + "learning_rate": 6.740554156171284e-08, + "logits/chosen": -2.7101967334747314, + "logits/rejected": -2.7053380012512207, + "logps/chosen": -208.09811401367188, + "logps/rejected": -186.99386596679688, + "loss": 0.6893, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03134473040699959, + "rewards/margins": 0.013868039473891258, + "rewards/rejected": 0.01747668907046318, + "step": 6620 + }, + { + "epoch": 1.16, + "learning_rate": 6.73551637279597e-08, + "logits/chosen": -2.791965961456299, + "logits/rejected": -2.7837865352630615, + "logps/chosen": -208.32333374023438, + "logps/rejected": -211.68014526367188, + "loss": 0.6906, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.02462940290570259, + "rewards/margins": 0.0018524207407608628, + "rewards/rejected": 0.022776981815695763, + "step": 6630 + }, + { + "epoch": 1.16, + "learning_rate": 6.730478589420655e-08, + "logits/chosen": -2.769686222076416, + "logits/rejected": -2.740999937057495, + "logps/chosen": -241.9813690185547, + "logps/rejected": -229.87850952148438, + "loss": 0.6885, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.03970779478549957, + "rewards/margins": 0.005852693226188421, + "rewards/rejected": 0.03385510295629501, + "step": 6640 + }, + { + "epoch": 1.16, + "learning_rate": 6.725440806045339e-08, + "logits/chosen": -2.763948440551758, + "logits/rejected": -2.793121814727783, + "logps/chosen": -297.51629638671875, + "logps/rejected": -206.64999389648438, + "loss": 0.6892, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.04574600234627724, + "rewards/margins": 0.01908976212143898, + "rewards/rejected": 0.02665623463690281, + "step": 6650 + }, + { + "epoch": 1.17, + "learning_rate": 6.720403022670024e-08, + "logits/chosen": -2.7918996810913086, + "logits/rejected": -2.747771978378296, + "logps/chosen": -217.94424438476562, + "logps/rejected": -168.6347198486328, + "loss": 0.6898, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.02763747237622738, + "rewards/margins": 0.00968779344111681, + "rewards/rejected": 0.017949678003787994, + "step": 6660 + }, + { + "epoch": 1.17, + "learning_rate": 6.71536523929471e-08, + "logits/chosen": -2.796182155609131, + "logits/rejected": -2.7847232818603516, + "logps/chosen": -263.08062744140625, + "logps/rejected": -272.1901550292969, + "loss": 0.6905, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.036897528916597366, + "rewards/margins": 0.00214485265314579, + "rewards/rejected": 0.034752678126096725, + "step": 6670 + }, + { + "epoch": 1.17, + "learning_rate": 6.710327455919395e-08, + "logits/chosen": -2.7384700775146484, + "logits/rejected": -2.7586898803710938, + "logps/chosen": -263.4530029296875, + "logps/rejected": -232.83840942382812, + "loss": 0.6897, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.035116128623485565, + "rewards/margins": 0.007391026709228754, + "rewards/rejected": 0.027725106105208397, + "step": 6680 + }, + { + "epoch": 1.17, + "learning_rate": 6.70528967254408e-08, + "logits/chosen": -2.75610089302063, + "logits/rejected": -2.781942367553711, + "logps/chosen": -215.61819458007812, + "logps/rejected": -199.6807098388672, + "loss": 0.6886, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.028895875439047813, + "rewards/margins": -0.0010175227653235197, + "rewards/rejected": 0.02991339936852455, + "step": 6690 + }, + { + "epoch": 1.17, + "learning_rate": 6.700251889168766e-08, + "logits/chosen": -2.722428798675537, + "logits/rejected": -2.7623000144958496, + "logps/chosen": -260.5478210449219, + "logps/rejected": -204.60206604003906, + "loss": 0.6896, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.04780068248510361, + "rewards/margins": 0.013338456861674786, + "rewards/rejected": 0.03446222469210625, + "step": 6700 + }, + { + "epoch": 1.18, + "learning_rate": 6.695214105793451e-08, + "logits/chosen": -2.8044791221618652, + "logits/rejected": -2.7793936729431152, + "logps/chosen": -286.1170959472656, + "logps/rejected": -230.1556396484375, + "loss": 0.6905, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.043489281088113785, + "rewards/margins": 0.013985136523842812, + "rewards/rejected": 0.029504140838980675, + "step": 6710 + }, + { + "epoch": 1.18, + "learning_rate": 6.690176322418136e-08, + "logits/chosen": -2.701599597930908, + "logits/rejected": -2.7080159187316895, + "logps/chosen": -230.49649047851562, + "logps/rejected": -155.5298309326172, + "loss": 0.6887, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.034238483756780624, + "rewards/margins": 0.015169240534305573, + "rewards/rejected": 0.0190692450851202, + "step": 6720 + }, + { + "epoch": 1.18, + "learning_rate": 6.68513853904282e-08, + "logits/chosen": -2.689814329147339, + "logits/rejected": -2.642368793487549, + "logps/chosen": -195.3006134033203, + "logps/rejected": -173.03106689453125, + "loss": 0.6876, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.029249629005789757, + "rewards/margins": 0.012950867414474487, + "rewards/rejected": 0.01629875972867012, + "step": 6730 + }, + { + "epoch": 1.18, + "learning_rate": 6.680100755667506e-08, + "logits/chosen": -2.7278635501861572, + "logits/rejected": -2.732556104660034, + "logps/chosen": -243.13375854492188, + "logps/rejected": -198.23207092285156, + "loss": 0.6898, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.03910071402788162, + "rewards/margins": 0.012855380773544312, + "rewards/rejected": 0.02624533139169216, + "step": 6740 + }, + { + "epoch": 1.18, + "learning_rate": 6.675062972292191e-08, + "logits/chosen": -2.7523670196533203, + "logits/rejected": -2.750101089477539, + "logps/chosen": -240.2274627685547, + "logps/rejected": -221.08053588867188, + "loss": 0.6893, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.040501974523067474, + "rewards/margins": 0.01037162821739912, + "rewards/rejected": 0.030130350962281227, + "step": 6750 + }, + { + "epoch": 1.18, + "learning_rate": 6.670025188916877e-08, + "logits/chosen": -2.802891254425049, + "logits/rejected": -2.7591326236724854, + "logps/chosen": -266.6939697265625, + "logps/rejected": -221.074462890625, + "loss": 0.6898, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.037126895040273666, + "rewards/margins": 0.00036938933772034943, + "rewards/rejected": 0.03675750270485878, + "step": 6760 + }, + { + "epoch": 1.19, + "learning_rate": 6.66498740554156e-08, + "logits/chosen": -2.8116838932037354, + "logits/rejected": -2.735592842102051, + "logps/chosen": -245.67007446289062, + "logps/rejected": -214.1964569091797, + "loss": 0.6882, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.0364735908806324, + "rewards/margins": 0.009604789316654205, + "rewards/rejected": 0.026868799701333046, + "step": 6770 + }, + { + "epoch": 1.19, + "learning_rate": 6.659949622166246e-08, + "logits/chosen": -2.8009650707244873, + "logits/rejected": -2.7831168174743652, + "logps/chosen": -213.4352569580078, + "logps/rejected": -164.82901000976562, + "loss": 0.6883, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.02785235084593296, + "rewards/margins": 0.01253105141222477, + "rewards/rejected": 0.01532130129635334, + "step": 6780 + }, + { + "epoch": 1.19, + "learning_rate": 6.654911838790931e-08, + "logits/chosen": -2.6899755001068115, + "logits/rejected": -2.7289154529571533, + "logps/chosen": -199.33334350585938, + "logps/rejected": -205.575439453125, + "loss": 0.6909, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.03206375241279602, + "rewards/margins": 0.001432869117707014, + "rewards/rejected": 0.03063088282942772, + "step": 6790 + }, + { + "epoch": 1.19, + "learning_rate": 6.649874055415617e-08, + "logits/chosen": -2.6635406017303467, + "logits/rejected": -2.7157580852508545, + "logps/chosen": -196.7146453857422, + "logps/rejected": -176.63833618164062, + "loss": 0.6903, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.031799446791410446, + "rewards/margins": 0.008729107677936554, + "rewards/rejected": 0.02307034283876419, + "step": 6800 + }, + { + "epoch": 1.19, + "learning_rate": 6.644836272040302e-08, + "logits/chosen": -2.8116531372070312, + "logits/rejected": -2.779773235321045, + "logps/chosen": -196.38583374023438, + "logps/rejected": -194.5372314453125, + "loss": 0.6897, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03152305632829666, + "rewards/margins": 0.006186535116285086, + "rewards/rejected": 0.02533651888370514, + "step": 6810 + }, + { + "epoch": 1.19, + "learning_rate": 6.639798488664987e-08, + "logits/chosen": -2.771275043487549, + "logits/rejected": -2.77402925491333, + "logps/chosen": -235.0574493408203, + "logps/rejected": -201.66380310058594, + "loss": 0.6903, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.040426142513751984, + "rewards/margins": 0.007161187473684549, + "rewards/rejected": 0.033264946192502975, + "step": 6820 + }, + { + "epoch": 1.2, + "learning_rate": 6.634760705289673e-08, + "logits/chosen": -2.8188562393188477, + "logits/rejected": -2.7583014965057373, + "logps/chosen": -241.53237915039062, + "logps/rejected": -216.1865997314453, + "loss": 0.6895, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.037272509187459946, + "rewards/margins": 0.004425130784511566, + "rewards/rejected": 0.03284738212823868, + "step": 6830 + }, + { + "epoch": 1.2, + "learning_rate": 6.629722921914357e-08, + "logits/chosen": -2.8168251514434814, + "logits/rejected": -2.748887062072754, + "logps/chosen": -261.4979248046875, + "logps/rejected": -232.7153778076172, + "loss": 0.6889, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.041307780891656876, + "rewards/margins": 0.01554332859814167, + "rewards/rejected": 0.025764450430870056, + "step": 6840 + }, + { + "epoch": 1.2, + "learning_rate": 6.624685138539042e-08, + "logits/chosen": -2.751751661300659, + "logits/rejected": -2.7708382606506348, + "logps/chosen": -273.7115783691406, + "logps/rejected": -220.8414306640625, + "loss": 0.6894, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.037936046719551086, + "rewards/margins": 0.006723390426486731, + "rewards/rejected": 0.03121265396475792, + "step": 6850 + }, + { + "epoch": 1.2, + "learning_rate": 6.619647355163728e-08, + "logits/chosen": -2.800870180130005, + "logits/rejected": -2.7695047855377197, + "logps/chosen": -238.0107421875, + "logps/rejected": -195.6055450439453, + "loss": 0.6899, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03982401639223099, + "rewards/margins": 0.009933261200785637, + "rewards/rejected": 0.0298907570540905, + "step": 6860 + }, + { + "epoch": 1.2, + "learning_rate": 6.614609571788413e-08, + "logits/chosen": -2.7755208015441895, + "logits/rejected": -2.731126070022583, + "logps/chosen": -205.5043487548828, + "logps/rejected": -194.66209411621094, + "loss": 0.6888, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.03579959273338318, + "rewards/margins": 0.009841179475188255, + "rewards/rejected": 0.025958415120840073, + "step": 6870 + }, + { + "epoch": 1.21, + "learning_rate": 6.609571788413097e-08, + "logits/chosen": -2.7811360359191895, + "logits/rejected": -2.747478485107422, + "logps/chosen": -218.49624633789062, + "logps/rejected": -224.67333984375, + "loss": 0.6916, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.03223881870508194, + "rewards/margins": -0.00041040778160095215, + "rewards/rejected": 0.03264923021197319, + "step": 6880 + }, + { + "epoch": 1.21, + "learning_rate": 6.604534005037782e-08, + "logits/chosen": -2.829068660736084, + "logits/rejected": -2.851719617843628, + "logps/chosen": -255.1793670654297, + "logps/rejected": -238.48300170898438, + "loss": 0.6894, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.031496562063694, + "rewards/margins": 0.0001958387001650408, + "rewards/rejected": 0.03130072355270386, + "step": 6890 + }, + { + "epoch": 1.21, + "learning_rate": 6.599496221662468e-08, + "logits/chosen": -2.751180410385132, + "logits/rejected": -2.813422679901123, + "logps/chosen": -252.8855438232422, + "logps/rejected": -217.68637084960938, + "loss": 0.6894, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.03818538039922714, + "rewards/margins": 0.0018034654203802347, + "rewards/rejected": 0.03638191893696785, + "step": 6900 + }, + { + "epoch": 1.21, + "learning_rate": 6.594458438287154e-08, + "logits/chosen": -2.712439775466919, + "logits/rejected": -2.7637240886688232, + "logps/chosen": -294.4551086425781, + "logps/rejected": -206.96664428710938, + "loss": 0.69, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.03531162813305855, + "rewards/margins": 0.006781014613807201, + "rewards/rejected": 0.028530608862638474, + "step": 6910 + }, + { + "epoch": 1.21, + "learning_rate": 6.589420654911838e-08, + "logits/chosen": -2.796703577041626, + "logits/rejected": -2.817638635635376, + "logps/chosen": -186.1031951904297, + "logps/rejected": -150.4288787841797, + "loss": 0.688, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.027689915150403976, + "rewards/margins": 0.010430497117340565, + "rewards/rejected": 0.017259418964385986, + "step": 6920 + }, + { + "epoch": 1.21, + "learning_rate": 6.584382871536524e-08, + "logits/chosen": -2.7453088760375977, + "logits/rejected": -2.776571750640869, + "logps/chosen": -225.50698852539062, + "logps/rejected": -196.79696655273438, + "loss": 0.6888, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03130626305937767, + "rewards/margins": 0.006553110666573048, + "rewards/rejected": 0.0247531495988369, + "step": 6930 + }, + { + "epoch": 1.22, + "learning_rate": 6.579345088161209e-08, + "logits/chosen": -2.7517857551574707, + "logits/rejected": -2.759016513824463, + "logps/chosen": -189.88516235351562, + "logps/rejected": -184.5245819091797, + "loss": 0.6896, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.02992168627679348, + "rewards/margins": 0.001992257311940193, + "rewards/rejected": 0.027929430827498436, + "step": 6940 + }, + { + "epoch": 1.22, + "learning_rate": 6.574307304785894e-08, + "logits/chosen": -2.815490245819092, + "logits/rejected": -2.803900718688965, + "logps/chosen": -210.9685821533203, + "logps/rejected": -191.39927673339844, + "loss": 0.6907, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.034951768815517426, + "rewards/margins": 0.0016877256566658616, + "rewards/rejected": 0.03326404467225075, + "step": 6950 + }, + { + "epoch": 1.22, + "learning_rate": 6.569269521410579e-08, + "logits/chosen": -2.803596019744873, + "logits/rejected": -2.786287546157837, + "logps/chosen": -248.3104248046875, + "logps/rejected": -213.3457489013672, + "loss": 0.689, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04742354154586792, + "rewards/margins": 0.01468456070870161, + "rewards/rejected": 0.032738976180553436, + "step": 6960 + }, + { + "epoch": 1.22, + "learning_rate": 6.564231738035264e-08, + "logits/chosen": -2.7051408290863037, + "logits/rejected": -2.6857523918151855, + "logps/chosen": -226.7938232421875, + "logps/rejected": -225.24612426757812, + "loss": 0.6894, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.03250659257173538, + "rewards/margins": -0.001109436503611505, + "rewards/rejected": 0.03361602872610092, + "step": 6970 + }, + { + "epoch": 1.22, + "learning_rate": 6.559193954659949e-08, + "logits/chosen": -2.7691562175750732, + "logits/rejected": -2.7059037685394287, + "logps/chosen": -235.966552734375, + "logps/rejected": -244.332275390625, + "loss": 0.691, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.03826393932104111, + "rewards/margins": 0.002380301710218191, + "rewards/rejected": 0.03588363528251648, + "step": 6980 + }, + { + "epoch": 1.22, + "learning_rate": 6.554156171284635e-08, + "logits/chosen": -2.773897647857666, + "logits/rejected": -2.8118696212768555, + "logps/chosen": -279.00213623046875, + "logps/rejected": -199.22181701660156, + "loss": 0.6897, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.03939899057149887, + "rewards/margins": 0.010439836420118809, + "rewards/rejected": 0.028959155082702637, + "step": 6990 + }, + { + "epoch": 1.23, + "learning_rate": 6.549118387909319e-08, + "logits/chosen": -2.78377366065979, + "logits/rejected": -2.8232734203338623, + "logps/chosen": -222.0625, + "logps/rejected": -167.61061096191406, + "loss": 0.6889, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03677304834127426, + "rewards/margins": 0.011829810217022896, + "rewards/rejected": 0.024943236261606216, + "step": 7000 + }, + { + "epoch": 1.23, + "learning_rate": 6.544080604534004e-08, + "logits/chosen": -2.801302671432495, + "logits/rejected": -2.7772815227508545, + "logps/chosen": -223.4099884033203, + "logps/rejected": -201.2372283935547, + "loss": 0.6891, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.034436147660017014, + "rewards/margins": 0.012764090672135353, + "rewards/rejected": 0.02167206071317196, + "step": 7010 + }, + { + "epoch": 1.23, + "learning_rate": 6.539042821158691e-08, + "logits/chosen": -2.726637601852417, + "logits/rejected": -2.7596089839935303, + "logps/chosen": -244.93588256835938, + "logps/rejected": -204.8834991455078, + "loss": 0.6892, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03578575700521469, + "rewards/margins": 0.005086420103907585, + "rewards/rejected": 0.030699338763952255, + "step": 7020 + }, + { + "epoch": 1.23, + "learning_rate": 6.534005037783376e-08, + "logits/chosen": -2.778423547744751, + "logits/rejected": -2.8102736473083496, + "logps/chosen": -235.8497772216797, + "logps/rejected": -181.15029907226562, + "loss": 0.6885, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.0325014665722847, + "rewards/margins": 0.010433828458189964, + "rewards/rejected": 0.022067639976739883, + "step": 7030 + }, + { + "epoch": 1.23, + "learning_rate": 6.52896725440806e-08, + "logits/chosen": -2.790149211883545, + "logits/rejected": -2.782501459121704, + "logps/chosen": -244.16952514648438, + "logps/rejected": -217.7505340576172, + "loss": 0.6898, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.032779667526483536, + "rewards/margins": 0.004313626326620579, + "rewards/rejected": 0.028466040268540382, + "step": 7040 + }, + { + "epoch": 1.23, + "learning_rate": 6.523929471032745e-08, + "logits/chosen": -2.685401201248169, + "logits/rejected": -2.7205746173858643, + "logps/chosen": -246.46542358398438, + "logps/rejected": -218.16384887695312, + "loss": 0.6883, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03928607702255249, + "rewards/margins": 0.012703100219368935, + "rewards/rejected": 0.026582980528473854, + "step": 7050 + }, + { + "epoch": 1.24, + "learning_rate": 6.518891687657431e-08, + "logits/chosen": -2.763960599899292, + "logits/rejected": -2.6985137462615967, + "logps/chosen": -219.4324188232422, + "logps/rejected": -199.53598022460938, + "loss": 0.6894, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03679573908448219, + "rewards/margins": 0.003578348783776164, + "rewards/rejected": 0.03321739658713341, + "step": 7060 + }, + { + "epoch": 1.24, + "learning_rate": 6.513853904282116e-08, + "logits/chosen": -2.739204168319702, + "logits/rejected": -2.721792221069336, + "logps/chosen": -221.15011596679688, + "logps/rejected": -224.3832550048828, + "loss": 0.6879, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.03717418760061264, + "rewards/margins": 0.006488792598247528, + "rewards/rejected": 0.030685395002365112, + "step": 7070 + }, + { + "epoch": 1.24, + "learning_rate": 6.5088161209068e-08, + "logits/chosen": -2.763201951980591, + "logits/rejected": -2.816208839416504, + "logps/chosen": -219.6378631591797, + "logps/rejected": -171.7489471435547, + "loss": 0.6893, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.03814969211816788, + "rewards/margins": 0.015910113230347633, + "rewards/rejected": 0.02223958447575569, + "step": 7080 + }, + { + "epoch": 1.24, + "learning_rate": 6.503778337531486e-08, + "logits/chosen": -2.749999523162842, + "logits/rejected": -2.7644400596618652, + "logps/chosen": -256.59527587890625, + "logps/rejected": -254.48568725585938, + "loss": 0.6909, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": 0.029433051124215126, + "rewards/margins": -0.0038326564244925976, + "rewards/rejected": 0.03326570615172386, + "step": 7090 + }, + { + "epoch": 1.24, + "learning_rate": 6.498740554156171e-08, + "logits/chosen": -2.7424628734588623, + "logits/rejected": -2.669203281402588, + "logps/chosen": -217.8045654296875, + "logps/rejected": -284.6188049316406, + "loss": 0.6892, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.03091282583773136, + "rewards/margins": -0.0043990714475512505, + "rewards/rejected": 0.03531189635396004, + "step": 7100 + }, + { + "epoch": 1.25, + "learning_rate": 6.493702770780855e-08, + "logits/chosen": -2.7484242916107178, + "logits/rejected": -2.7699131965637207, + "logps/chosen": -222.022705078125, + "logps/rejected": -180.71083068847656, + "loss": 0.6901, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03578049689531326, + "rewards/margins": 0.007164050824940205, + "rewards/rejected": 0.028616448864340782, + "step": 7110 + }, + { + "epoch": 1.25, + "learning_rate": 6.48866498740554e-08, + "logits/chosen": -2.7241392135620117, + "logits/rejected": -2.7856979370117188, + "logps/chosen": -220.6631317138672, + "logps/rejected": -172.29763793945312, + "loss": 0.6881, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.03620423376560211, + "rewards/margins": 0.01442769169807434, + "rewards/rejected": 0.02177654579281807, + "step": 7120 + }, + { + "epoch": 1.25, + "learning_rate": 6.483627204030227e-08, + "logits/chosen": -2.6797337532043457, + "logits/rejected": -2.677027702331543, + "logps/chosen": -216.7772979736328, + "logps/rejected": -199.2020721435547, + "loss": 0.6881, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03498489409685135, + "rewards/margins": 0.0047217002138495445, + "rewards/rejected": 0.03026319481432438, + "step": 7130 + }, + { + "epoch": 1.25, + "learning_rate": 6.478589420654912e-08, + "logits/chosen": -2.7731869220733643, + "logits/rejected": -2.758033275604248, + "logps/chosen": -210.3363037109375, + "logps/rejected": -220.9199676513672, + "loss": 0.688, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.03830721229314804, + "rewards/margins": 0.009248893707990646, + "rewards/rejected": 0.029058322310447693, + "step": 7140 + }, + { + "epoch": 1.25, + "learning_rate": 6.473551637279596e-08, + "logits/chosen": -2.840115547180176, + "logits/rejected": -2.8175790309906006, + "logps/chosen": -228.0071258544922, + "logps/rejected": -200.12808227539062, + "loss": 0.6891, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03204935044050217, + "rewards/margins": 0.0035434868186712265, + "rewards/rejected": 0.02850586175918579, + "step": 7150 + }, + { + "epoch": 1.25, + "learning_rate": 6.468513853904282e-08, + "logits/chosen": -2.7763142585754395, + "logits/rejected": -2.729067802429199, + "logps/chosen": -198.84445190429688, + "logps/rejected": -188.24356079101562, + "loss": 0.6889, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.02600068226456642, + "rewards/margins": 0.002334971446543932, + "rewards/rejected": 0.023665711283683777, + "step": 7160 + }, + { + "epoch": 1.26, + "learning_rate": 6.463476070528967e-08, + "logits/chosen": -2.790109395980835, + "logits/rejected": -2.776125431060791, + "logps/chosen": -250.983642578125, + "logps/rejected": -225.20327758789062, + "loss": 0.6897, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.05125053972005844, + "rewards/margins": 0.00900472141802311, + "rewards/rejected": 0.042245812714099884, + "step": 7170 + }, + { + "epoch": 1.26, + "learning_rate": 6.458438287153653e-08, + "logits/chosen": -2.85467529296875, + "logits/rejected": -2.8630192279815674, + "logps/chosen": -248.15420532226562, + "logps/rejected": -203.410400390625, + "loss": 0.6895, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.0435900017619133, + "rewards/margins": 0.013718393631279469, + "rewards/rejected": 0.02987160161137581, + "step": 7180 + }, + { + "epoch": 1.26, + "learning_rate": 6.453400503778337e-08, + "logits/chosen": -2.787590503692627, + "logits/rejected": -2.786054849624634, + "logps/chosen": -215.96484375, + "logps/rejected": -205.36135864257812, + "loss": 0.6911, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.030155668035149574, + "rewards/margins": 0.001419505337253213, + "rewards/rejected": 0.028736162930727005, + "step": 7190 + }, + { + "epoch": 1.26, + "learning_rate": 6.448362720403022e-08, + "logits/chosen": -2.7419791221618652, + "logits/rejected": -2.7809367179870605, + "logps/chosen": -231.2300262451172, + "logps/rejected": -209.7133026123047, + "loss": 0.689, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.043003469705581665, + "rewards/margins": 0.012471351772546768, + "rewards/rejected": 0.030532116070389748, + "step": 7200 + }, + { + "epoch": 1.26, + "learning_rate": 6.443324937027707e-08, + "logits/chosen": -2.771419048309326, + "logits/rejected": -2.7687599658966064, + "logps/chosen": -266.37310791015625, + "logps/rejected": -210.47946166992188, + "loss": 0.6914, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.035980530083179474, + "rewards/margins": 0.006279982626438141, + "rewards/rejected": 0.02970055118203163, + "step": 7210 + }, + { + "epoch": 1.26, + "learning_rate": 6.438287153652393e-08, + "logits/chosen": -2.7209925651550293, + "logits/rejected": -2.753868579864502, + "logps/chosen": -244.1683349609375, + "logps/rejected": -209.34567260742188, + "loss": 0.6902, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04534623771905899, + "rewards/margins": 0.00936298631131649, + "rewards/rejected": 0.03598325327038765, + "step": 7220 + }, + { + "epoch": 1.27, + "learning_rate": 6.433249370277077e-08, + "logits/chosen": -2.7852845191955566, + "logits/rejected": -2.7609314918518066, + "logps/chosen": -219.0021209716797, + "logps/rejected": -212.36203002929688, + "loss": 0.6908, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.034276049584150314, + "rewards/margins": 0.008765382692217827, + "rewards/rejected": 0.025510672479867935, + "step": 7230 + }, + { + "epoch": 1.27, + "learning_rate": 6.428211586901763e-08, + "logits/chosen": -2.7715468406677246, + "logits/rejected": -2.7390708923339844, + "logps/chosen": -244.0713348388672, + "logps/rejected": -203.73193359375, + "loss": 0.6893, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.04323107749223709, + "rewards/margins": 0.014766479842364788, + "rewards/rejected": 0.02846459485590458, + "step": 7240 + }, + { + "epoch": 1.27, + "learning_rate": 6.423173803526449e-08, + "logits/chosen": -2.7359414100646973, + "logits/rejected": -2.7200896739959717, + "logps/chosen": -236.83010864257812, + "logps/rejected": -222.8236083984375, + "loss": 0.6886, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03487788513302803, + "rewards/margins": 0.003767541376873851, + "rewards/rejected": 0.03111034631729126, + "step": 7250 + }, + { + "epoch": 1.27, + "learning_rate": 6.418136020151134e-08, + "logits/chosen": -2.7496371269226074, + "logits/rejected": -2.7715988159179688, + "logps/chosen": -237.1099395751953, + "logps/rejected": -190.89756774902344, + "loss": 0.6883, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.04079810902476311, + "rewards/margins": 0.012925440445542336, + "rewards/rejected": 0.027872666716575623, + "step": 7260 + }, + { + "epoch": 1.27, + "learning_rate": 6.413098236775818e-08, + "logits/chosen": -2.79183292388916, + "logits/rejected": -2.8067638874053955, + "logps/chosen": -239.8271484375, + "logps/rejected": -196.8553924560547, + "loss": 0.6886, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.04036902263760567, + "rewards/margins": 0.008599973283708096, + "rewards/rejected": 0.031769048422575, + "step": 7270 + }, + { + "epoch": 1.28, + "learning_rate": 6.408060453400504e-08, + "logits/chosen": -2.7779862880706787, + "logits/rejected": -2.7364373207092285, + "logps/chosen": -215.1895294189453, + "logps/rejected": -221.6739501953125, + "loss": 0.6881, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03108001872897148, + "rewards/margins": 0.007479669060558081, + "rewards/rejected": 0.023600349202752113, + "step": 7280 + }, + { + "epoch": 1.28, + "learning_rate": 6.403022670025189e-08, + "logits/chosen": -2.7336158752441406, + "logits/rejected": -2.7742183208465576, + "logps/chosen": -224.93276977539062, + "logps/rejected": -220.05130004882812, + "loss": 0.6887, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.032671328634023666, + "rewards/margins": 0.004601246677339077, + "rewards/rejected": 0.028070081025362015, + "step": 7290 + }, + { + "epoch": 1.28, + "learning_rate": 6.397984886649874e-08, + "logits/chosen": -2.704530715942383, + "logits/rejected": -2.6919538974761963, + "logps/chosen": -196.310546875, + "logps/rejected": -192.64761352539062, + "loss": 0.6893, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.034642450511455536, + "rewards/margins": 0.008061992935836315, + "rewards/rejected": 0.026580458506941795, + "step": 7300 + }, + { + "epoch": 1.28, + "learning_rate": 6.392947103274558e-08, + "logits/chosen": -2.7123913764953613, + "logits/rejected": -2.692824602127075, + "logps/chosen": -200.9581756591797, + "logps/rejected": -160.29251098632812, + "loss": 0.6897, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.030062520876526833, + "rewards/margins": 0.012599813751876354, + "rewards/rejected": 0.017462706193327904, + "step": 7310 + }, + { + "epoch": 1.28, + "learning_rate": 6.387909319899244e-08, + "logits/chosen": -2.7910399436950684, + "logits/rejected": -2.8223717212677, + "logps/chosen": -243.82861328125, + "logps/rejected": -190.62478637695312, + "loss": 0.6883, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": 0.05294889211654663, + "rewards/margins": 0.02855229750275612, + "rewards/rejected": 0.024396590888500214, + "step": 7320 + }, + { + "epoch": 1.28, + "learning_rate": 6.382871536523929e-08, + "logits/chosen": -2.7878623008728027, + "logits/rejected": -2.789745330810547, + "logps/chosen": -279.63775634765625, + "logps/rejected": -233.55050659179688, + "loss": 0.6891, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.04993782192468643, + "rewards/margins": 0.010094448924064636, + "rewards/rejected": 0.039843373000621796, + "step": 7330 + }, + { + "epoch": 1.29, + "learning_rate": 6.377833753148614e-08, + "logits/chosen": -2.8130502700805664, + "logits/rejected": -2.828782796859741, + "logps/chosen": -216.92153930664062, + "logps/rejected": -179.07345581054688, + "loss": 0.6902, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.037634026259183884, + "rewards/margins": 0.011927349492907524, + "rewards/rejected": 0.02570667862892151, + "step": 7340 + }, + { + "epoch": 1.29, + "learning_rate": 6.3727959697733e-08, + "logits/chosen": -2.717914342880249, + "logits/rejected": -2.771929979324341, + "logps/chosen": -272.27349853515625, + "logps/rejected": -217.73965454101562, + "loss": 0.6891, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.04304666072130203, + "rewards/margins": 0.01667637750506401, + "rewards/rejected": 0.026370281353592873, + "step": 7350 + }, + { + "epoch": 1.29, + "learning_rate": 6.367758186397985e-08, + "logits/chosen": -2.7765262126922607, + "logits/rejected": -2.756239175796509, + "logps/chosen": -245.5876922607422, + "logps/rejected": -211.84426879882812, + "loss": 0.6886, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.04092712327837944, + "rewards/margins": 0.010894590988755226, + "rewards/rejected": 0.030032526701688766, + "step": 7360 + }, + { + "epoch": 1.29, + "learning_rate": 6.36272040302267e-08, + "logits/chosen": -2.7805514335632324, + "logits/rejected": -2.779824733734131, + "logps/chosen": -232.1643829345703, + "logps/rejected": -227.3907470703125, + "loss": 0.6903, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.04033838212490082, + "rewards/margins": -0.0015016479883342981, + "rewards/rejected": 0.041840024292469025, + "step": 7370 + }, + { + "epoch": 1.29, + "learning_rate": 6.357682619647356e-08, + "logits/chosen": -2.715909004211426, + "logits/rejected": -2.6816649436950684, + "logps/chosen": -183.8916473388672, + "logps/rejected": -177.9539794921875, + "loss": 0.69, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.02817304991185665, + "rewards/margins": 0.002602068241685629, + "rewards/rejected": 0.025570983067154884, + "step": 7380 + }, + { + "epoch": 1.29, + "learning_rate": 6.35264483627204e-08, + "logits/chosen": -2.764040470123291, + "logits/rejected": -2.7185869216918945, + "logps/chosen": -279.495361328125, + "logps/rejected": -254.57553100585938, + "loss": 0.688, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.04607158154249191, + "rewards/margins": 0.00835057720541954, + "rewards/rejected": 0.037721000611782074, + "step": 7390 + }, + { + "epoch": 1.3, + "learning_rate": 6.347607052896725e-08, + "logits/chosen": -2.691213607788086, + "logits/rejected": -2.580820083618164, + "logps/chosen": -216.9579620361328, + "logps/rejected": -203.49806213378906, + "loss": 0.6893, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.03406810015439987, + "rewards/margins": 0.004827213007956743, + "rewards/rejected": 0.029240887612104416, + "step": 7400 + }, + { + "epoch": 1.3, + "learning_rate": 6.34256926952141e-08, + "logits/chosen": -2.789217710494995, + "logits/rejected": -2.7983765602111816, + "logps/chosen": -259.81915283203125, + "logps/rejected": -181.50772094726562, + "loss": 0.6889, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": 0.038249146193265915, + "rewards/margins": 0.019794996827840805, + "rewards/rejected": 0.01845415122807026, + "step": 7410 + }, + { + "epoch": 1.3, + "learning_rate": 6.337531486146095e-08, + "logits/chosen": -2.7692363262176514, + "logits/rejected": -2.7888898849487305, + "logps/chosen": -251.02481079101562, + "logps/rejected": -207.87417602539062, + "loss": 0.689, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0431194081902504, + "rewards/margins": 0.009726546704769135, + "rewards/rejected": 0.03339286148548126, + "step": 7420 + }, + { + "epoch": 1.3, + "learning_rate": 6.33249370277078e-08, + "logits/chosen": -2.8098390102386475, + "logits/rejected": -2.824765682220459, + "logps/chosen": -288.68280029296875, + "logps/rejected": -209.61767578125, + "loss": 0.6864, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.048886384814977646, + "rewards/margins": 0.018948834389448166, + "rewards/rejected": 0.02993755042552948, + "step": 7430 + }, + { + "epoch": 1.3, + "learning_rate": 6.327455919395465e-08, + "logits/chosen": -2.7200918197631836, + "logits/rejected": -2.791701316833496, + "logps/chosen": -197.84213256835938, + "logps/rejected": -163.2316436767578, + "loss": 0.69, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03175193443894386, + "rewards/margins": 0.009572578594088554, + "rewards/rejected": 0.022179359570145607, + "step": 7440 + }, + { + "epoch": 1.3, + "learning_rate": 6.322418136020151e-08, + "logits/chosen": -2.7373557090759277, + "logits/rejected": -2.7854480743408203, + "logps/chosen": -183.2852325439453, + "logps/rejected": -177.6833038330078, + "loss": 0.6893, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03157498314976692, + "rewards/margins": 0.005984650459140539, + "rewards/rejected": 0.025590334087610245, + "step": 7450 + }, + { + "epoch": 1.31, + "learning_rate": 6.317380352644836e-08, + "logits/chosen": -2.798292875289917, + "logits/rejected": -2.690913677215576, + "logps/chosen": -223.384033203125, + "logps/rejected": -191.24310302734375, + "loss": 0.6894, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03310397267341614, + "rewards/margins": 0.01318474393337965, + "rewards/rejected": 0.019919229671359062, + "step": 7460 + }, + { + "epoch": 1.31, + "learning_rate": 6.312342569269521e-08, + "logits/chosen": -2.8380043506622314, + "logits/rejected": -2.7938342094421387, + "logps/chosen": -252.09130859375, + "logps/rejected": -234.51791381835938, + "loss": 0.6881, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04607817903161049, + "rewards/margins": 0.009110006503760815, + "rewards/rejected": 0.0369681641459465, + "step": 7470 + }, + { + "epoch": 1.31, + "learning_rate": 6.307304785894207e-08, + "logits/chosen": -2.7199976444244385, + "logits/rejected": -2.7746763229370117, + "logps/chosen": -224.08078002929688, + "logps/rejected": -199.91787719726562, + "loss": 0.6891, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03400200232863426, + "rewards/margins": 0.0022418289445340633, + "rewards/rejected": 0.03176017105579376, + "step": 7480 + }, + { + "epoch": 1.31, + "learning_rate": 6.302267002518892e-08, + "logits/chosen": -2.731687068939209, + "logits/rejected": -2.7257843017578125, + "logps/chosen": -239.6183624267578, + "logps/rejected": -202.96115112304688, + "loss": 0.6883, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03186950460076332, + "rewards/margins": 0.008324464783072472, + "rewards/rejected": 0.023545041680336, + "step": 7490 + }, + { + "epoch": 1.31, + "learning_rate": 6.297229219143576e-08, + "logits/chosen": -2.738438129425049, + "logits/rejected": -2.806363821029663, + "logps/chosen": -176.00735473632812, + "logps/rejected": -169.10317993164062, + "loss": 0.6886, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.033585112541913986, + "rewards/margins": 0.007096168585121632, + "rewards/rejected": 0.02648894488811493, + "step": 7500 + }, + { + "epoch": 1.32, + "learning_rate": 6.292191435768262e-08, + "logits/chosen": -2.7676918506622314, + "logits/rejected": -2.723275899887085, + "logps/chosen": -244.68380737304688, + "logps/rejected": -214.3140869140625, + "loss": 0.6881, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.049413811415433884, + "rewards/margins": 0.013775454834103584, + "rewards/rejected": 0.03563835844397545, + "step": 7510 + }, + { + "epoch": 1.32, + "learning_rate": 6.287153652392947e-08, + "logits/chosen": -2.7488560676574707, + "logits/rejected": -2.771021842956543, + "logps/chosen": -209.1370849609375, + "logps/rejected": -213.5133056640625, + "loss": 0.6881, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.033164605498313904, + "rewards/margins": 0.0037708343006670475, + "rewards/rejected": 0.029393767938017845, + "step": 7520 + }, + { + "epoch": 1.32, + "learning_rate": 6.282115869017632e-08, + "logits/chosen": -2.7546322345733643, + "logits/rejected": -2.8115854263305664, + "logps/chosen": -228.2063751220703, + "logps/rejected": -213.37265014648438, + "loss": 0.6904, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.042360819876194, + "rewards/margins": 0.0021514396648854017, + "rewards/rejected": 0.04020937532186508, + "step": 7530 + }, + { + "epoch": 1.32, + "learning_rate": 6.277078085642316e-08, + "logits/chosen": -2.8055498600006104, + "logits/rejected": -2.8536624908447266, + "logps/chosen": -249.27444458007812, + "logps/rejected": -214.2854766845703, + "loss": 0.6912, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03579330071806908, + "rewards/margins": 0.0017019972437992692, + "rewards/rejected": 0.03409130498766899, + "step": 7540 + }, + { + "epoch": 1.32, + "learning_rate": 6.272040302267002e-08, + "logits/chosen": -2.7170093059539795, + "logits/rejected": -2.7954814434051514, + "logps/chosen": -202.75704956054688, + "logps/rejected": -189.86465454101562, + "loss": 0.6892, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03642931208014488, + "rewards/margins": 0.004201197065412998, + "rewards/rejected": 0.03222811967134476, + "step": 7550 + }, + { + "epoch": 1.32, + "learning_rate": 6.267002518891687e-08, + "logits/chosen": -2.6571552753448486, + "logits/rejected": -2.666952133178711, + "logps/chosen": -255.24887084960938, + "logps/rejected": -238.71731567382812, + "loss": 0.6889, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03816863149404526, + "rewards/margins": 0.0025174126494675875, + "rewards/rejected": 0.03565122187137604, + "step": 7560 + }, + { + "epoch": 1.33, + "learning_rate": 6.261964735516372e-08, + "logits/chosen": -2.7783854007720947, + "logits/rejected": -2.782365322113037, + "logps/chosen": -278.375732421875, + "logps/rejected": -238.59201049804688, + "loss": 0.6902, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.05053055286407471, + "rewards/margins": 0.008491361513733864, + "rewards/rejected": 0.042039185762405396, + "step": 7570 + }, + { + "epoch": 1.33, + "learning_rate": 6.256926952141058e-08, + "logits/chosen": -2.7886173725128174, + "logits/rejected": -2.8333420753479004, + "logps/chosen": -265.0281677246094, + "logps/rejected": -229.58602905273438, + "loss": 0.6894, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03801819309592247, + "rewards/margins": 0.005499082151800394, + "rewards/rejected": 0.032519109547138214, + "step": 7580 + }, + { + "epoch": 1.33, + "learning_rate": 6.251889168765743e-08, + "logits/chosen": -2.7609009742736816, + "logits/rejected": -2.722909450531006, + "logps/chosen": -224.86181640625, + "logps/rejected": -174.26095581054688, + "loss": 0.6867, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.04278299957513809, + "rewards/margins": 0.019222671166062355, + "rewards/rejected": 0.023560328409075737, + "step": 7590 + }, + { + "epoch": 1.33, + "learning_rate": 6.246851385390429e-08, + "logits/chosen": -2.7045106887817383, + "logits/rejected": -2.762742519378662, + "logps/chosen": -226.1327362060547, + "logps/rejected": -192.94805908203125, + "loss": 0.6891, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03624294325709343, + "rewards/margins": 0.008845340460538864, + "rewards/rejected": 0.027397602796554565, + "step": 7600 + }, + { + "epoch": 1.33, + "learning_rate": 6.241813602015114e-08, + "logits/chosen": -2.7494304180145264, + "logits/rejected": -2.7993853092193604, + "logps/chosen": -240.58883666992188, + "logps/rejected": -228.0128631591797, + "loss": 0.6872, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.051678262650966644, + "rewards/margins": 0.012700071558356285, + "rewards/rejected": 0.038978200405836105, + "step": 7610 + }, + { + "epoch": 1.33, + "learning_rate": 6.236775818639798e-08, + "logits/chosen": -2.705895185470581, + "logits/rejected": -2.704624891281128, + "logps/chosen": -237.9052734375, + "logps/rejected": -214.38229370117188, + "loss": 0.6887, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0426960252225399, + "rewards/margins": 0.01083569135516882, + "rewards/rejected": 0.03186033293604851, + "step": 7620 + }, + { + "epoch": 1.34, + "learning_rate": 6.231738035264483e-08, + "logits/chosen": -2.694300889968872, + "logits/rejected": -2.7320556640625, + "logps/chosen": -244.7444305419922, + "logps/rejected": -211.509521484375, + "loss": 0.6882, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.04373529553413391, + "rewards/margins": 0.009587273001670837, + "rewards/rejected": 0.034148018807172775, + "step": 7630 + }, + { + "epoch": 1.34, + "learning_rate": 6.226700251889169e-08, + "logits/chosen": -2.657388687133789, + "logits/rejected": -2.7366836071014404, + "logps/chosen": -284.2294921875, + "logps/rejected": -204.66275024414062, + "loss": 0.6884, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.047968313097953796, + "rewards/margins": 0.021980399265885353, + "rewards/rejected": 0.025987911969423294, + "step": 7640 + }, + { + "epoch": 1.34, + "learning_rate": 6.221662468513854e-08, + "logits/chosen": -2.7871079444885254, + "logits/rejected": -2.742713451385498, + "logps/chosen": -217.3256072998047, + "logps/rejected": -193.50462341308594, + "loss": 0.6891, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04595683142542839, + "rewards/margins": 0.014400948770344257, + "rewards/rejected": 0.03155588358640671, + "step": 7650 + }, + { + "epoch": 1.34, + "learning_rate": 6.216624685138538e-08, + "logits/chosen": -2.7406857013702393, + "logits/rejected": -2.7888526916503906, + "logps/chosen": -274.1748962402344, + "logps/rejected": -234.21694946289062, + "loss": 0.6902, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.04528680071234703, + "rewards/margins": 0.00935632549226284, + "rewards/rejected": 0.03593047335743904, + "step": 7660 + }, + { + "epoch": 1.34, + "learning_rate": 6.211586901763223e-08, + "logits/chosen": -2.7559306621551514, + "logits/rejected": -2.737565755844116, + "logps/chosen": -202.5470428466797, + "logps/rejected": -195.29730224609375, + "loss": 0.6876, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.04031279683113098, + "rewards/margins": 0.015136400237679482, + "rewards/rejected": 0.02517639473080635, + "step": 7670 + }, + { + "epoch": 1.35, + "learning_rate": 6.206549118387909e-08, + "logits/chosen": -2.7704107761383057, + "logits/rejected": -2.7382752895355225, + "logps/chosen": -218.0789031982422, + "logps/rejected": -188.13656616210938, + "loss": 0.6889, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03927340358495712, + "rewards/margins": 0.005905534606426954, + "rewards/rejected": 0.03336786851286888, + "step": 7680 + }, + { + "epoch": 1.35, + "learning_rate": 6.201511335012594e-08, + "logits/chosen": -2.860550880432129, + "logits/rejected": -2.737292528152466, + "logps/chosen": -204.9586181640625, + "logps/rejected": -200.66024780273438, + "loss": 0.6898, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.03624052554368973, + "rewards/margins": 0.00042196764843538404, + "rewards/rejected": 0.03581856191158295, + "step": 7690 + }, + { + "epoch": 1.35, + "learning_rate": 6.19647355163728e-08, + "logits/chosen": -2.827122211456299, + "logits/rejected": -2.780107021331787, + "logps/chosen": -205.1537628173828, + "logps/rejected": -179.7675018310547, + "loss": 0.6877, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03878549858927727, + "rewards/margins": 0.011726005002856255, + "rewards/rejected": 0.027059491723775864, + "step": 7700 + }, + { + "epoch": 1.35, + "learning_rate": 6.191435768261965e-08, + "logits/chosen": -2.7009811401367188, + "logits/rejected": -2.671569347381592, + "logps/chosen": -197.73291015625, + "logps/rejected": -186.85595703125, + "loss": 0.6911, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.025883939117193222, + "rewards/margins": 0.004282969981431961, + "rewards/rejected": 0.02160097099840641, + "step": 7710 + }, + { + "epoch": 1.35, + "learning_rate": 6.18639798488665e-08, + "logits/chosen": -2.832324266433716, + "logits/rejected": -2.758772850036621, + "logps/chosen": -247.593017578125, + "logps/rejected": -217.5821533203125, + "loss": 0.6867, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.05130542069673538, + "rewards/margins": 0.017530951648950577, + "rewards/rejected": 0.033774472773075104, + "step": 7720 + }, + { + "epoch": 1.35, + "learning_rate": 6.181360201511334e-08, + "logits/chosen": -2.813231945037842, + "logits/rejected": -2.801682949066162, + "logps/chosen": -224.65103149414062, + "logps/rejected": -162.23861694335938, + "loss": 0.6883, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.04042666405439377, + "rewards/margins": 0.014801084995269775, + "rewards/rejected": 0.02562558650970459, + "step": 7730 + }, + { + "epoch": 1.36, + "learning_rate": 6.17632241813602e-08, + "logits/chosen": -2.7659387588500977, + "logits/rejected": -2.734480619430542, + "logps/chosen": -200.85885620117188, + "logps/rejected": -178.37416076660156, + "loss": 0.6863, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.04493881016969681, + "rewards/margins": 0.014324108138680458, + "rewards/rejected": 0.030614707618951797, + "step": 7740 + }, + { + "epoch": 1.36, + "learning_rate": 6.171284634760705e-08, + "logits/chosen": -2.7255687713623047, + "logits/rejected": -2.718503713607788, + "logps/chosen": -214.28494262695312, + "logps/rejected": -213.13113403320312, + "loss": 0.6882, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.04565887898206711, + "rewards/margins": 0.004408498294651508, + "rewards/rejected": 0.041250377893447876, + "step": 7750 + }, + { + "epoch": 1.36, + "learning_rate": 6.16624685138539e-08, + "logits/chosen": -2.802783489227295, + "logits/rejected": -2.802086591720581, + "logps/chosen": -226.2981414794922, + "logps/rejected": -178.6344757080078, + "loss": 0.6887, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03931064531207085, + "rewards/margins": 0.010295582935214043, + "rewards/rejected": 0.029015064239501953, + "step": 7760 + }, + { + "epoch": 1.36, + "learning_rate": 6.161209068010074e-08, + "logits/chosen": -2.771225690841675, + "logits/rejected": -2.7833735942840576, + "logps/chosen": -181.8852081298828, + "logps/rejected": -168.8794708251953, + "loss": 0.6892, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.02663729153573513, + "rewards/margins": 0.00531434640288353, + "rewards/rejected": 0.0213229488581419, + "step": 7770 + }, + { + "epoch": 1.36, + "learning_rate": 6.15617128463476e-08, + "logits/chosen": -2.755722761154175, + "logits/rejected": -2.7322795391082764, + "logps/chosen": -201.41317749023438, + "logps/rejected": -173.2834014892578, + "loss": 0.6873, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.041012976318597794, + "rewards/margins": 0.010555104352533817, + "rewards/rejected": 0.03045787289738655, + "step": 7780 + }, + { + "epoch": 1.36, + "learning_rate": 6.151133501259445e-08, + "logits/chosen": -2.802394390106201, + "logits/rejected": -2.768019676208496, + "logps/chosen": -194.97853088378906, + "logps/rejected": -155.97921752929688, + "loss": 0.688, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03568575531244278, + "rewards/margins": 0.010065983049571514, + "rewards/rejected": 0.02561977133154869, + "step": 7790 + }, + { + "epoch": 1.37, + "learning_rate": 6.14609571788413e-08, + "logits/chosen": -2.8079912662506104, + "logits/rejected": -2.8577840328216553, + "logps/chosen": -259.79791259765625, + "logps/rejected": -228.3444366455078, + "loss": 0.6892, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.04476379603147507, + "rewards/margins": 0.0020954939536750317, + "rewards/rejected": 0.04266830533742905, + "step": 7800 + }, + { + "epoch": 1.37, + "learning_rate": 6.141057934508816e-08, + "logits/chosen": -2.6792571544647217, + "logits/rejected": -2.672581195831299, + "logps/chosen": -195.576416015625, + "logps/rejected": -212.009033203125, + "loss": 0.6878, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.031648848205804825, + "rewards/margins": -0.004404547158628702, + "rewards/rejected": 0.03605339676141739, + "step": 7810 + }, + { + "epoch": 1.37, + "learning_rate": 6.136020151133501e-08, + "logits/chosen": -2.752152681350708, + "logits/rejected": -2.6936943531036377, + "logps/chosen": -199.6970977783203, + "logps/rejected": -192.76779174804688, + "loss": 0.6888, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03685902804136276, + "rewards/margins": 0.012366501614451408, + "rewards/rejected": 0.024492528289556503, + "step": 7820 + }, + { + "epoch": 1.37, + "learning_rate": 6.130982367758187e-08, + "logits/chosen": -2.7500405311584473, + "logits/rejected": -2.7712624073028564, + "logps/chosen": -225.90231323242188, + "logps/rejected": -223.07925415039062, + "loss": 0.6887, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.04552388936281204, + "rewards/margins": 0.004638020880520344, + "rewards/rejected": 0.04088587313890457, + "step": 7830 + }, + { + "epoch": 1.37, + "learning_rate": 6.125944584382872e-08, + "logits/chosen": -2.759676218032837, + "logits/rejected": -2.7632689476013184, + "logps/chosen": -265.64593505859375, + "logps/rejected": -209.3302459716797, + "loss": 0.6883, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.04995828866958618, + "rewards/margins": 0.014445647597312927, + "rewards/rejected": 0.035512641072273254, + "step": 7840 + }, + { + "epoch": 1.38, + "learning_rate": 6.120906801007556e-08, + "logits/chosen": -2.7992868423461914, + "logits/rejected": -2.786892890930176, + "logps/chosen": -246.7543182373047, + "logps/rejected": -220.26803588867188, + "loss": 0.69, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.04133310541510582, + "rewards/margins": 0.005543719045817852, + "rewards/rejected": 0.03578938916325569, + "step": 7850 + }, + { + "epoch": 1.38, + "learning_rate": 6.115869017632241e-08, + "logits/chosen": -2.7453935146331787, + "logits/rejected": -2.8089358806610107, + "logps/chosen": -205.07772827148438, + "logps/rejected": -183.50558471679688, + "loss": 0.6874, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.034324247390031815, + "rewards/margins": 0.010133923031389713, + "rewards/rejected": 0.024190323427319527, + "step": 7860 + }, + { + "epoch": 1.38, + "learning_rate": 6.110831234256927e-08, + "logits/chosen": -2.785832166671753, + "logits/rejected": -2.8203999996185303, + "logps/chosen": -229.1759033203125, + "logps/rejected": -201.36029052734375, + "loss": 0.6897, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.04147273674607277, + "rewards/margins": 0.00905263889580965, + "rewards/rejected": 0.032420095056295395, + "step": 7870 + }, + { + "epoch": 1.38, + "learning_rate": 6.105793450881612e-08, + "logits/chosen": -2.708287000656128, + "logits/rejected": -2.7692911624908447, + "logps/chosen": -221.4902801513672, + "logps/rejected": -197.06146240234375, + "loss": 0.688, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.04135482385754585, + "rewards/margins": 0.010591486468911171, + "rewards/rejected": 0.030763333663344383, + "step": 7880 + }, + { + "epoch": 1.38, + "learning_rate": 6.100755667506296e-08, + "logits/chosen": -2.724555253982544, + "logits/rejected": -2.7219367027282715, + "logps/chosen": -177.3289337158203, + "logps/rejected": -170.86984252929688, + "loss": 0.6896, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.031236102804541588, + "rewards/margins": 0.005766207817941904, + "rewards/rejected": 0.025469893589615822, + "step": 7890 + }, + { + "epoch": 1.38, + "learning_rate": 6.095717884130982e-08, + "logits/chosen": -2.713719367980957, + "logits/rejected": -2.7233357429504395, + "logps/chosen": -233.9386749267578, + "logps/rejected": -172.72366333007812, + "loss": 0.6905, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.045443419367074966, + "rewards/margins": 0.016218410804867744, + "rewards/rejected": 0.02922501601278782, + "step": 7900 + }, + { + "epoch": 1.39, + "learning_rate": 6.090680100755667e-08, + "logits/chosen": -2.775986433029175, + "logits/rejected": -2.727430582046509, + "logps/chosen": -224.6809844970703, + "logps/rejected": -196.10922241210938, + "loss": 0.6887, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03934579715132713, + "rewards/margins": 0.008914479985833168, + "rewards/rejected": 0.030431320890784264, + "step": 7910 + }, + { + "epoch": 1.39, + "learning_rate": 6.085642317380352e-08, + "logits/chosen": -2.781262159347534, + "logits/rejected": -2.7013962268829346, + "logps/chosen": -210.90963745117188, + "logps/rejected": -203.32460021972656, + "loss": 0.6883, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.033894848078489304, + "rewards/margins": 0.0063673751428723335, + "rewards/rejected": 0.027527472004294395, + "step": 7920 + }, + { + "epoch": 1.39, + "learning_rate": 6.080604534005038e-08, + "logits/chosen": -2.781320095062256, + "logits/rejected": -2.7733845710754395, + "logps/chosen": -240.52676391601562, + "logps/rejected": -226.217041015625, + "loss": 0.6893, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.04577254876494408, + "rewards/margins": 0.007031611166894436, + "rewards/rejected": 0.038740936666727066, + "step": 7930 + }, + { + "epoch": 1.39, + "learning_rate": 6.075566750629723e-08, + "logits/chosen": -2.7862772941589355, + "logits/rejected": -2.7734897136688232, + "logps/chosen": -232.9326934814453, + "logps/rejected": -199.85308837890625, + "loss": 0.6887, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.037640467286109924, + "rewards/margins": 0.00660460302606225, + "rewards/rejected": 0.03103586472570896, + "step": 7940 + }, + { + "epoch": 1.39, + "learning_rate": 6.070528967254408e-08, + "logits/chosen": -2.747159481048584, + "logits/rejected": -2.6515073776245117, + "logps/chosen": -235.05618286132812, + "logps/rejected": -231.2899932861328, + "loss": 0.6873, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.05150740593671799, + "rewards/margins": 0.015792617574334145, + "rewards/rejected": 0.03571479022502899, + "step": 7950 + }, + { + "epoch": 1.39, + "learning_rate": 6.065491183879094e-08, + "logits/chosen": -2.6942429542541504, + "logits/rejected": -2.7198643684387207, + "logps/chosen": -248.2423553466797, + "logps/rejected": -197.20497131347656, + "loss": 0.6894, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.04131951555609703, + "rewards/margins": 0.014284191653132439, + "rewards/rejected": 0.027035322040319443, + "step": 7960 + }, + { + "epoch": 1.4, + "learning_rate": 6.060453400503778e-08, + "logits/chosen": -2.7588915824890137, + "logits/rejected": -2.7787914276123047, + "logps/chosen": -242.1793975830078, + "logps/rejected": -204.95382690429688, + "loss": 0.6909, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.051094651222229004, + "rewards/margins": 0.0132598876953125, + "rewards/rejected": 0.037834759801626205, + "step": 7970 + }, + { + "epoch": 1.4, + "learning_rate": 6.055415617128463e-08, + "logits/chosen": -2.749837636947632, + "logits/rejected": -2.7630608081817627, + "logps/chosen": -258.34930419921875, + "logps/rejected": -182.1297607421875, + "loss": 0.6851, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": 0.04587540775537491, + "rewards/margins": 0.02240714430809021, + "rewards/rejected": 0.02346826158463955, + "step": 7980 + }, + { + "epoch": 1.4, + "learning_rate": 6.050377833753148e-08, + "logits/chosen": -2.76625919342041, + "logits/rejected": -2.7197346687316895, + "logps/chosen": -210.4891815185547, + "logps/rejected": -174.40744018554688, + "loss": 0.6865, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.04220408946275711, + "rewards/margins": 0.014574876055121422, + "rewards/rejected": 0.027629217132925987, + "step": 7990 + }, + { + "epoch": 1.4, + "learning_rate": 6.045340050377834e-08, + "logits/chosen": -2.7272531986236572, + "logits/rejected": -2.7292728424072266, + "logps/chosen": -224.6431427001953, + "logps/rejected": -181.2040557861328, + "loss": 0.6889, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.037466295063495636, + "rewards/margins": 0.013241834938526154, + "rewards/rejected": 0.024224456399679184, + "step": 8000 + }, + { + "epoch": 1.4, + "learning_rate": 6.040302267002518e-08, + "logits/chosen": -2.7375807762145996, + "logits/rejected": -2.7324814796447754, + "logps/chosen": -239.2186279296875, + "logps/rejected": -223.94253540039062, + "loss": 0.6891, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.051830459386110306, + "rewards/margins": 0.01332320086658001, + "rewards/rejected": 0.03850725665688515, + "step": 8010 + }, + { + "epoch": 1.4, + "learning_rate": 6.035264483627203e-08, + "logits/chosen": -2.787344217300415, + "logits/rejected": -2.757755756378174, + "logps/chosen": -214.58969116210938, + "logps/rejected": -212.26815795898438, + "loss": 0.6884, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.03871138021349907, + "rewards/margins": 0.001409774413332343, + "rewards/rejected": 0.03730160370469093, + "step": 8020 + }, + { + "epoch": 1.41, + "learning_rate": 6.030226700251889e-08, + "logits/chosen": -2.788583755493164, + "logits/rejected": -2.8225603103637695, + "logps/chosen": -299.5536193847656, + "logps/rejected": -207.89358520507812, + "loss": 0.6885, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.050768353044986725, + "rewards/margins": 0.012225328013300896, + "rewards/rejected": 0.03854302689433098, + "step": 8030 + }, + { + "epoch": 1.41, + "learning_rate": 6.025188916876574e-08, + "logits/chosen": -2.7606899738311768, + "logits/rejected": -2.760101079940796, + "logps/chosen": -203.7574920654297, + "logps/rejected": -188.63735961914062, + "loss": 0.6875, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03621258586645126, + "rewards/margins": 0.00680736918002367, + "rewards/rejected": 0.029405217617750168, + "step": 8040 + }, + { + "epoch": 1.41, + "learning_rate": 6.020151133501259e-08, + "logits/chosen": -2.7922425270080566, + "logits/rejected": -2.77087664604187, + "logps/chosen": -264.730712890625, + "logps/rejected": -229.2702178955078, + "loss": 0.6894, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.04078766703605652, + "rewards/margins": 0.005166265182197094, + "rewards/rejected": 0.03562140464782715, + "step": 8050 + }, + { + "epoch": 1.41, + "learning_rate": 6.015113350125945e-08, + "logits/chosen": -2.6650726795196533, + "logits/rejected": -2.699510335922241, + "logps/chosen": -241.74951171875, + "logps/rejected": -217.79312133789062, + "loss": 0.6895, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.04188552126288414, + "rewards/margins": -0.0013723727315664291, + "rewards/rejected": 0.04325789585709572, + "step": 8060 + }, + { + "epoch": 1.41, + "learning_rate": 6.01007556675063e-08, + "logits/chosen": -2.6361894607543945, + "logits/rejected": -2.804050922393799, + "logps/chosen": -209.30386352539062, + "logps/rejected": -223.2210693359375, + "loss": 0.6911, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.039837904274463654, + "rewards/margins": 0.003762881737202406, + "rewards/rejected": 0.03607501834630966, + "step": 8070 + }, + { + "epoch": 1.42, + "learning_rate": 6.005037783375314e-08, + "logits/chosen": -2.715277671813965, + "logits/rejected": -2.7054569721221924, + "logps/chosen": -249.8915557861328, + "logps/rejected": -224.6490020751953, + "loss": 0.6887, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.042900118976831436, + "rewards/margins": 0.008957276120781898, + "rewards/rejected": 0.03394284099340439, + "step": 8080 + }, + { + "epoch": 1.42, + "learning_rate": 6e-08, + "logits/chosen": -2.749920606613159, + "logits/rejected": -2.6681249141693115, + "logps/chosen": -262.42718505859375, + "logps/rejected": -270.71026611328125, + "loss": 0.6896, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.05033283308148384, + "rewards/margins": 0.003699377877637744, + "rewards/rejected": 0.04663345217704773, + "step": 8090 + }, + { + "epoch": 1.42, + "learning_rate": 5.994962216624685e-08, + "logits/chosen": -2.699763536453247, + "logits/rejected": -2.7738709449768066, + "logps/chosen": -254.59536743164062, + "logps/rejected": -225.08261108398438, + "loss": 0.6882, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.050733782351017, + "rewards/margins": 0.01060875691473484, + "rewards/rejected": 0.04012501984834671, + "step": 8100 + }, + { + "epoch": 1.42, + "learning_rate": 5.98992443324937e-08, + "logits/chosen": -2.791287899017334, + "logits/rejected": -2.747755765914917, + "logps/chosen": -200.8659210205078, + "logps/rejected": -184.97738647460938, + "loss": 0.6883, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03486446663737297, + "rewards/margins": 0.002834696788340807, + "rewards/rejected": 0.03202977031469345, + "step": 8110 + }, + { + "epoch": 1.42, + "learning_rate": 5.984886649874054e-08, + "logits/chosen": -2.6940653324127197, + "logits/rejected": -2.760707139968872, + "logps/chosen": -228.6831817626953, + "logps/rejected": -221.67361450195312, + "loss": 0.6887, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.04749389737844467, + "rewards/margins": 0.011963879689574242, + "rewards/rejected": 0.03553002327680588, + "step": 8120 + }, + { + "epoch": 1.42, + "learning_rate": 5.97984886649874e-08, + "logits/chosen": -2.7091734409332275, + "logits/rejected": -2.727992534637451, + "logps/chosen": -204.9541015625, + "logps/rejected": -178.6293487548828, + "loss": 0.6887, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0264905896037817, + "rewards/margins": 0.0013065729290246964, + "rewards/rejected": 0.025184014812111855, + "step": 8130 + }, + { + "epoch": 1.43, + "learning_rate": 5.974811083123425e-08, + "logits/chosen": -2.7273199558258057, + "logits/rejected": -2.7602429389953613, + "logps/chosen": -236.5217742919922, + "logps/rejected": -218.5023193359375, + "loss": 0.6888, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04743615910410881, + "rewards/margins": 0.007979987189173698, + "rewards/rejected": 0.03945617750287056, + "step": 8140 + }, + { + "epoch": 1.43, + "learning_rate": 5.96977329974811e-08, + "logits/chosen": -2.7114429473876953, + "logits/rejected": -2.7514827251434326, + "logps/chosen": -233.47323608398438, + "logps/rejected": -183.81675720214844, + "loss": 0.6869, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.046855200082063675, + "rewards/margins": 0.016597609966993332, + "rewards/rejected": 0.030257591977715492, + "step": 8150 + }, + { + "epoch": 1.43, + "learning_rate": 5.964735516372796e-08, + "logits/chosen": -2.7446465492248535, + "logits/rejected": -2.6851656436920166, + "logps/chosen": -206.99264526367188, + "logps/rejected": -168.73605346679688, + "loss": 0.6876, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03506845980882645, + "rewards/margins": 0.014280231669545174, + "rewards/rejected": 0.02078823372721672, + "step": 8160 + }, + { + "epoch": 1.43, + "learning_rate": 5.9596977329974804e-08, + "logits/chosen": -2.819230794906616, + "logits/rejected": -2.7767491340637207, + "logps/chosen": -244.1392059326172, + "logps/rejected": -208.48880004882812, + "loss": 0.6895, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.057758230715990067, + "rewards/margins": 0.0185552891343832, + "rewards/rejected": 0.039202939718961716, + "step": 8170 + }, + { + "epoch": 1.43, + "learning_rate": 5.9546599496221664e-08, + "logits/chosen": -2.7350716590881348, + "logits/rejected": -2.6791672706604004, + "logps/chosen": -200.4189910888672, + "logps/rejected": -196.80860900878906, + "loss": 0.6887, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.034190356731414795, + "rewards/margins": 0.00776415690779686, + "rewards/rejected": 0.026426201686263084, + "step": 8180 + }, + { + "epoch": 1.43, + "learning_rate": 5.949622166246852e-08, + "logits/chosen": -2.7582621574401855, + "logits/rejected": -2.7618229389190674, + "logps/chosen": -180.63294982910156, + "logps/rejected": -157.079833984375, + "loss": 0.6901, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.03690091520547867, + "rewards/margins": 0.011395210400223732, + "rewards/rejected": 0.025505702942609787, + "step": 8190 + }, + { + "epoch": 1.44, + "learning_rate": 5.944584382871536e-08, + "logits/chosen": -2.731879472732544, + "logits/rejected": -2.7573390007019043, + "logps/chosen": -210.488525390625, + "logps/rejected": -197.1478271484375, + "loss": 0.6868, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.047597721219062805, + "rewards/margins": 0.010359442792832851, + "rewards/rejected": 0.03723827749490738, + "step": 8200 + }, + { + "epoch": 1.44, + "learning_rate": 5.939546599496221e-08, + "logits/chosen": -2.7964818477630615, + "logits/rejected": -2.7716190814971924, + "logps/chosen": -220.36572265625, + "logps/rejected": -191.2345428466797, + "loss": 0.69, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.048532258719205856, + "rewards/margins": 0.012116949073970318, + "rewards/rejected": 0.03641531243920326, + "step": 8210 + }, + { + "epoch": 1.44, + "learning_rate": 5.9345088161209065e-08, + "logits/chosen": -2.768618106842041, + "logits/rejected": -2.745877265930176, + "logps/chosen": -241.71826171875, + "logps/rejected": -231.50302124023438, + "loss": 0.6923, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.04764752835035324, + "rewards/margins": 0.003467456204816699, + "rewards/rejected": 0.04418007284402847, + "step": 8220 + }, + { + "epoch": 1.44, + "learning_rate": 5.929471032745592e-08, + "logits/chosen": -2.7671141624450684, + "logits/rejected": -2.7717056274414062, + "logps/chosen": -282.21734619140625, + "logps/rejected": -230.12704467773438, + "loss": 0.689, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.05740467458963394, + "rewards/margins": 0.02093067206442356, + "rewards/rejected": 0.03647400066256523, + "step": 8230 + }, + { + "epoch": 1.44, + "learning_rate": 5.9244332493702766e-08, + "logits/chosen": -2.7785863876342773, + "logits/rejected": -2.7596054077148438, + "logps/chosen": -269.4919128417969, + "logps/rejected": -206.0177459716797, + "loss": 0.6885, + "rewards/accuracies": 0.75, + "rewards/chosen": 0.04548025503754616, + "rewards/margins": 0.017482586205005646, + "rewards/rejected": 0.02799767255783081, + "step": 8240 + }, + { + "epoch": 1.45, + "learning_rate": 5.919395465994962e-08, + "logits/chosen": -2.6811938285827637, + "logits/rejected": -2.731386184692383, + "logps/chosen": -189.69949340820312, + "logps/rejected": -172.76312255859375, + "loss": 0.687, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.038950253278017044, + "rewards/margins": 0.009141791611909866, + "rewards/rejected": 0.029808461666107178, + "step": 8250 + }, + { + "epoch": 1.45, + "learning_rate": 5.9143576826196473e-08, + "logits/chosen": -2.67179536819458, + "logits/rejected": -2.7431387901306152, + "logps/chosen": -238.79928588867188, + "logps/rejected": -197.96249389648438, + "loss": 0.6887, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.04331899806857109, + "rewards/margins": 0.00855275709182024, + "rewards/rejected": 0.03476623818278313, + "step": 8260 + }, + { + "epoch": 1.45, + "learning_rate": 5.909319899244333e-08, + "logits/chosen": -2.6874778270721436, + "logits/rejected": -2.7527995109558105, + "logps/chosen": -265.18646240234375, + "logps/rejected": -254.72055053710938, + "loss": 0.6902, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.04799005389213562, + "rewards/margins": 0.008365727961063385, + "rewards/rejected": 0.03962433338165283, + "step": 8270 + }, + { + "epoch": 1.45, + "learning_rate": 5.904282115869017e-08, + "logits/chosen": -2.775963068008423, + "logits/rejected": -2.7594003677368164, + "logps/chosen": -193.80345153808594, + "logps/rejected": -182.29696655273438, + "loss": 0.6904, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03241405636072159, + "rewards/margins": 0.0072534880600869656, + "rewards/rejected": 0.025160569697618484, + "step": 8280 + }, + { + "epoch": 1.45, + "learning_rate": 5.899244332493703e-08, + "logits/chosen": -2.7540886402130127, + "logits/rejected": -2.7759768962860107, + "logps/chosen": -256.3172912597656, + "logps/rejected": -248.9473114013672, + "loss": 0.6896, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.04200480133295059, + "rewards/margins": 0.005136861000210047, + "rewards/rejected": 0.03686793893575668, + "step": 8290 + }, + { + "epoch": 1.45, + "learning_rate": 5.894206549118388e-08, + "logits/chosen": -2.7550156116485596, + "logits/rejected": -2.8021984100341797, + "logps/chosen": -229.73519897460938, + "logps/rejected": -194.55474853515625, + "loss": 0.6892, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.040971461683511734, + "rewards/margins": 0.007404597010463476, + "rewards/rejected": 0.03356685861945152, + "step": 8300 + }, + { + "epoch": 1.46, + "learning_rate": 5.8891687657430735e-08, + "logits/chosen": -2.7880303859710693, + "logits/rejected": -2.7363808155059814, + "logps/chosen": -173.42591857910156, + "logps/rejected": -178.16490173339844, + "loss": 0.6883, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.03242052346467972, + "rewards/margins": 0.0012834550580009818, + "rewards/rejected": 0.03113706409931183, + "step": 8310 + }, + { + "epoch": 1.46, + "learning_rate": 5.8841309823677575e-08, + "logits/chosen": -2.7852296829223633, + "logits/rejected": -2.732570171356201, + "logps/chosen": -205.2123260498047, + "logps/rejected": -221.46542358398438, + "loss": 0.6887, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.037264786660671234, + "rewards/margins": -0.0015946425264701247, + "rewards/rejected": 0.038859423249959946, + "step": 8320 + }, + { + "epoch": 1.46, + "learning_rate": 5.879093198992443e-08, + "logits/chosen": -2.7393336296081543, + "logits/rejected": -2.750638484954834, + "logps/chosen": -200.95550537109375, + "logps/rejected": -182.22824096679688, + "loss": 0.6876, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03504057973623276, + "rewards/margins": 0.0032831882126629353, + "rewards/rejected": 0.03175738826394081, + "step": 8330 + }, + { + "epoch": 1.46, + "learning_rate": 5.874055415617128e-08, + "logits/chosen": -2.733309268951416, + "logits/rejected": -2.7839436531066895, + "logps/chosen": -209.6042022705078, + "logps/rejected": -167.40438842773438, + "loss": 0.6877, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.03753194957971573, + "rewards/margins": 0.0077357119880616665, + "rewards/rejected": 0.029796237125992775, + "step": 8340 + }, + { + "epoch": 1.46, + "learning_rate": 5.869017632241813e-08, + "logits/chosen": -2.8055219650268555, + "logits/rejected": -2.817014694213867, + "logps/chosen": -208.11178588867188, + "logps/rejected": -204.49551391601562, + "loss": 0.6887, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.036422837525606155, + "rewards/margins": 0.003470013616606593, + "rewards/rejected": 0.032952822744846344, + "step": 8350 + }, + { + "epoch": 1.46, + "learning_rate": 5.863979848866498e-08, + "logits/chosen": -2.8599841594696045, + "logits/rejected": -2.8321750164031982, + "logps/chosen": -245.27285766601562, + "logps/rejected": -233.36593627929688, + "loss": 0.689, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.045193519443273544, + "rewards/margins": 0.0070549556985497475, + "rewards/rejected": 0.03813857212662697, + "step": 8360 + }, + { + "epoch": 1.47, + "learning_rate": 5.858942065491184e-08, + "logits/chosen": -2.711230516433716, + "logits/rejected": -2.7263026237487793, + "logps/chosen": -247.5156707763672, + "logps/rejected": -204.61376953125, + "loss": 0.6859, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.06073460727930069, + "rewards/margins": 0.02463601343333721, + "rewards/rejected": 0.03609859198331833, + "step": 8370 + }, + { + "epoch": 1.47, + "learning_rate": 5.853904282115869e-08, + "logits/chosen": -2.771897315979004, + "logits/rejected": -2.770329713821411, + "logps/chosen": -261.06951904296875, + "logps/rejected": -264.5949401855469, + "loss": 0.6905, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.051393140107393265, + "rewards/margins": 0.006638474762439728, + "rewards/rejected": 0.04475466161966324, + "step": 8380 + }, + { + "epoch": 1.47, + "learning_rate": 5.848866498740553e-08, + "logits/chosen": -2.7597389221191406, + "logits/rejected": -2.7436418533325195, + "logps/chosen": -245.485595703125, + "logps/rejected": -207.4766845703125, + "loss": 0.6878, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.051292382180690765, + "rewards/margins": 0.012479810044169426, + "rewards/rejected": 0.03881257027387619, + "step": 8390 + }, + { + "epoch": 1.47, + "learning_rate": 5.843828715365239e-08, + "logits/chosen": -2.80478572845459, + "logits/rejected": -2.771780490875244, + "logps/chosen": -204.68588256835938, + "logps/rejected": -193.27899169921875, + "loss": 0.6904, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04538872465491295, + "rewards/margins": 0.008817224763333797, + "rewards/rejected": 0.03657149896025658, + "step": 8400 + }, + { + "epoch": 1.47, + "learning_rate": 5.8387909319899245e-08, + "logits/chosen": -2.7240943908691406, + "logits/rejected": -2.806950569152832, + "logps/chosen": -256.45501708984375, + "logps/rejected": -257.5248718261719, + "loss": 0.6887, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.056347597390413284, + "rewards/margins": 0.006222080439329147, + "rewards/rejected": 0.05012550950050354, + "step": 8410 + }, + { + "epoch": 1.47, + "learning_rate": 5.83375314861461e-08, + "logits/chosen": -2.7173569202423096, + "logits/rejected": -2.7189526557922363, + "logps/chosen": -238.66342163085938, + "logps/rejected": -196.93142700195312, + "loss": 0.6873, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.046293385326862335, + "rewards/margins": 0.011984572745859623, + "rewards/rejected": 0.03430881351232529, + "step": 8420 + }, + { + "epoch": 1.48, + "learning_rate": 5.828715365239294e-08, + "logits/chosen": -2.821493148803711, + "logits/rejected": -2.864586591720581, + "logps/chosen": -195.20623779296875, + "logps/rejected": -215.08755493164062, + "loss": 0.6894, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.038646843284368515, + "rewards/margins": 0.004198746755719185, + "rewards/rejected": 0.03444809466600418, + "step": 8430 + }, + { + "epoch": 1.48, + "learning_rate": 5.823677581863979e-08, + "logits/chosen": -2.680703639984131, + "logits/rejected": -2.7536604404449463, + "logps/chosen": -219.0048828125, + "logps/rejected": -202.65245056152344, + "loss": 0.6898, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.042999859899282455, + "rewards/margins": 0.009765975177288055, + "rewards/rejected": 0.0332338847219944, + "step": 8440 + }, + { + "epoch": 1.48, + "learning_rate": 5.8186397984886646e-08, + "logits/chosen": -2.7437472343444824, + "logits/rejected": -2.7347023487091064, + "logps/chosen": -196.41883850097656, + "logps/rejected": -166.17236328125, + "loss": 0.6883, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03196621313691139, + "rewards/margins": 0.008594868704676628, + "rewards/rejected": 0.023371344432234764, + "step": 8450 + }, + { + "epoch": 1.48, + "learning_rate": 5.81360201511335e-08, + "logits/chosen": -2.737215518951416, + "logits/rejected": -2.731224536895752, + "logps/chosen": -232.0885772705078, + "logps/rejected": -181.93997192382812, + "loss": 0.6881, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.041482407599687576, + "rewards/margins": 0.011339427903294563, + "rewards/rejected": 0.030142977833747864, + "step": 8460 + }, + { + "epoch": 1.48, + "learning_rate": 5.808564231738035e-08, + "logits/chosen": -2.743090867996216, + "logits/rejected": -2.6777594089508057, + "logps/chosen": -185.24954223632812, + "logps/rejected": -203.14199829101562, + "loss": 0.6897, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.02936091460287571, + "rewards/margins": 0.0038882705848664045, + "rewards/rejected": 0.025472644716501236, + "step": 8470 + }, + { + "epoch": 1.49, + "learning_rate": 5.80352644836272e-08, + "logits/chosen": -2.778669595718384, + "logits/rejected": -2.7191758155822754, + "logps/chosen": -235.8621063232422, + "logps/rejected": -230.335205078125, + "loss": 0.6885, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.03947572037577629, + "rewards/margins": 0.003947444260120392, + "rewards/rejected": 0.0355282798409462, + "step": 8480 + }, + { + "epoch": 1.49, + "learning_rate": 5.7984886649874054e-08, + "logits/chosen": -2.7726998329162598, + "logits/rejected": -2.8148016929626465, + "logps/chosen": -250.29202270507812, + "logps/rejected": -219.3681182861328, + "loss": 0.6879, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.05604994297027588, + "rewards/margins": 0.015362827107310295, + "rewards/rejected": 0.040687110275030136, + "step": 8490 + }, + { + "epoch": 1.49, + "learning_rate": 5.793450881612091e-08, + "logits/chosen": -2.778038740158081, + "logits/rejected": -2.7753331661224365, + "logps/chosen": -206.3338623046875, + "logps/rejected": -184.36129760742188, + "loss": 0.6886, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03952028229832649, + "rewards/margins": 0.009847410954535007, + "rewards/rejected": 0.029672876000404358, + "step": 8500 + }, + { + "epoch": 1.49, + "learning_rate": 5.7884130982367755e-08, + "logits/chosen": -2.7196013927459717, + "logits/rejected": -2.8112895488739014, + "logps/chosen": -204.50921630859375, + "logps/rejected": -174.06558227539062, + "loss": 0.6882, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04074891284108162, + "rewards/margins": 0.0165697168558836, + "rewards/rejected": 0.02417919412255287, + "step": 8510 + }, + { + "epoch": 1.49, + "learning_rate": 5.783375314861461e-08, + "logits/chosen": -2.7498068809509277, + "logits/rejected": -2.757819414138794, + "logps/chosen": -201.4228057861328, + "logps/rejected": -219.12399291992188, + "loss": 0.6885, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.037325937300920486, + "rewards/margins": -0.0009258370846509933, + "rewards/rejected": 0.03825177252292633, + "step": 8520 + }, + { + "epoch": 1.49, + "learning_rate": 5.778337531486146e-08, + "logits/chosen": -2.7941741943359375, + "logits/rejected": -2.7413251399993896, + "logps/chosen": -224.0157012939453, + "logps/rejected": -202.8053436279297, + "loss": 0.6884, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04527192562818527, + "rewards/margins": 0.014141691848635674, + "rewards/rejected": 0.031130235642194748, + "step": 8530 + }, + { + "epoch": 1.5, + "learning_rate": 5.7732997481108316e-08, + "logits/chosen": -2.8099892139434814, + "logits/rejected": -2.757983684539795, + "logps/chosen": -243.79086303710938, + "logps/rejected": -223.33932495117188, + "loss": 0.6898, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.04493292048573494, + "rewards/margins": 0.0019141886150464416, + "rewards/rejected": 0.04301873594522476, + "step": 8540 + }, + { + "epoch": 1.5, + "learning_rate": 5.7682619647355156e-08, + "logits/chosen": -2.784567356109619, + "logits/rejected": -2.7672345638275146, + "logps/chosen": -235.2530059814453, + "logps/rejected": -210.9793701171875, + "loss": 0.6881, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.05156296491622925, + "rewards/margins": 0.007609918713569641, + "rewards/rejected": 0.043953049927949905, + "step": 8550 + }, + { + "epoch": 1.5, + "learning_rate": 5.763224181360201e-08, + "logits/chosen": -2.818497896194458, + "logits/rejected": -2.760577440261841, + "logps/chosen": -234.3348388671875, + "logps/rejected": -193.94863891601562, + "loss": 0.6871, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.05081092566251755, + "rewards/margins": 0.01714308187365532, + "rewards/rejected": 0.03366784378886223, + "step": 8560 + }, + { + "epoch": 1.5, + "learning_rate": 5.758186397984886e-08, + "logits/chosen": -2.7838993072509766, + "logits/rejected": -2.7389278411865234, + "logps/chosen": -220.52511596679688, + "logps/rejected": -211.15255737304688, + "loss": 0.6888, + "rewards/accuracies": 0.375, + "rewards/chosen": 0.035474494099617004, + "rewards/margins": -0.0008419624646194279, + "rewards/rejected": 0.03631645813584328, + "step": 8570 + }, + { + "epoch": 1.5, + "learning_rate": 5.753148614609572e-08, + "logits/chosen": -2.788435459136963, + "logits/rejected": -2.7799055576324463, + "logps/chosen": -216.87448120117188, + "logps/rejected": -198.84854125976562, + "loss": 0.6883, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.038950562477111816, + "rewards/margins": 0.015099948272109032, + "rewards/rejected": 0.023850608617067337, + "step": 8580 + }, + { + "epoch": 1.5, + "learning_rate": 5.7481108312342564e-08, + "logits/chosen": -2.7052228450775146, + "logits/rejected": -2.6766791343688965, + "logps/chosen": -183.8777618408203, + "logps/rejected": -182.99578857421875, + "loss": 0.6892, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04428397864103317, + "rewards/margins": 0.010991683229804039, + "rewards/rejected": 0.03329230099916458, + "step": 8590 + }, + { + "epoch": 1.51, + "learning_rate": 5.743073047858942e-08, + "logits/chosen": -2.815370559692383, + "logits/rejected": -2.7483325004577637, + "logps/chosen": -202.84475708007812, + "logps/rejected": -165.16668701171875, + "loss": 0.6854, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.045902546495199203, + "rewards/margins": 0.022786486893892288, + "rewards/rejected": 0.023116057738661766, + "step": 8600 + }, + { + "epoch": 1.51, + "learning_rate": 5.738035264483627e-08, + "logits/chosen": -2.7344138622283936, + "logits/rejected": -2.7439301013946533, + "logps/chosen": -226.06161499023438, + "logps/rejected": -174.56552124023438, + "loss": 0.6868, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.039994433522224426, + "rewards/margins": 0.020141465589404106, + "rewards/rejected": 0.01985296607017517, + "step": 8610 + }, + { + "epoch": 1.51, + "learning_rate": 5.7329974811083125e-08, + "logits/chosen": -2.8340532779693604, + "logits/rejected": -2.7644944190979004, + "logps/chosen": -207.7313690185547, + "logps/rejected": -182.41390991210938, + "loss": 0.6868, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.03946467861533165, + "rewards/margins": 0.01365002989768982, + "rewards/rejected": 0.02581464685499668, + "step": 8620 + }, + { + "epoch": 1.51, + "learning_rate": 5.727959697732997e-08, + "logits/chosen": -2.798107624053955, + "logits/rejected": -2.7637317180633545, + "logps/chosen": -257.6904296875, + "logps/rejected": -244.3838348388672, + "loss": 0.6882, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04575506970286369, + "rewards/margins": 0.006212930660694838, + "rewards/rejected": 0.03954214230179787, + "step": 8630 + }, + { + "epoch": 1.51, + "learning_rate": 5.7229219143576825e-08, + "logits/chosen": -2.7994701862335205, + "logits/rejected": -2.774688959121704, + "logps/chosen": -220.4487762451172, + "logps/rejected": -172.90780639648438, + "loss": 0.6893, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.043639928102493286, + "rewards/margins": 0.01047286856919527, + "rewards/rejected": 0.03316705673933029, + "step": 8640 + }, + { + "epoch": 1.52, + "learning_rate": 5.717884130982368e-08, + "logits/chosen": -2.764247417449951, + "logits/rejected": -2.743495464324951, + "logps/chosen": -239.54025268554688, + "logps/rejected": -214.3405303955078, + "loss": 0.6875, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03702837601304054, + "rewards/margins": 0.012995190918445587, + "rewards/rejected": 0.024033186957240105, + "step": 8650 + }, + { + "epoch": 1.52, + "learning_rate": 5.712846347607052e-08, + "logits/chosen": -2.7130041122436523, + "logits/rejected": -2.7699601650238037, + "logps/chosen": -237.2503204345703, + "logps/rejected": -185.75486755371094, + "loss": 0.6877, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.04563732072710991, + "rewards/margins": 0.015573574230074883, + "rewards/rejected": 0.030063744634389877, + "step": 8660 + }, + { + "epoch": 1.52, + "learning_rate": 5.707808564231737e-08, + "logits/chosen": -2.774289608001709, + "logits/rejected": -2.7651114463806152, + "logps/chosen": -269.4395751953125, + "logps/rejected": -211.79531860351562, + "loss": 0.6894, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.05132768303155899, + "rewards/margins": 0.011847235262393951, + "rewards/rejected": 0.039480455219745636, + "step": 8670 + }, + { + "epoch": 1.52, + "learning_rate": 5.702770780856423e-08, + "logits/chosen": -2.7488410472869873, + "logits/rejected": -2.811511516571045, + "logps/chosen": -230.3901824951172, + "logps/rejected": -180.4424591064453, + "loss": 0.6856, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.05101857706904411, + "rewards/margins": 0.01628846302628517, + "rewards/rejected": 0.03473011404275894, + "step": 8680 + }, + { + "epoch": 1.52, + "learning_rate": 5.697732997481108e-08, + "logits/chosen": -2.715552568435669, + "logits/rejected": -2.745255947113037, + "logps/chosen": -223.7119903564453, + "logps/rejected": -228.6637725830078, + "loss": 0.6869, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.05288667604327202, + "rewards/margins": 0.007302626967430115, + "rewards/rejected": 0.045584045350551605, + "step": 8690 + }, + { + "epoch": 1.52, + "learning_rate": 5.692695214105793e-08, + "logits/chosen": -2.757916212081909, + "logits/rejected": -2.6959335803985596, + "logps/chosen": -219.01956176757812, + "logps/rejected": -228.71627807617188, + "loss": 0.6875, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.05256640911102295, + "rewards/margins": 0.006362512707710266, + "rewards/rejected": 0.046203892678022385, + "step": 8700 + }, + { + "epoch": 1.53, + "learning_rate": 5.687657430730478e-08, + "logits/chosen": -2.8467657566070557, + "logits/rejected": -2.7943410873413086, + "logps/chosen": -219.20028686523438, + "logps/rejected": -235.470703125, + "loss": 0.6871, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.045346882194280624, + "rewards/margins": 0.001881635980680585, + "rewards/rejected": 0.04346524551510811, + "step": 8710 + }, + { + "epoch": 1.53, + "learning_rate": 5.6826196473551635e-08, + "logits/chosen": -2.8179268836975098, + "logits/rejected": -2.793691396713257, + "logps/chosen": -269.15374755859375, + "logps/rejected": -207.63232421875, + "loss": 0.6889, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.053640447556972504, + "rewards/margins": 0.012012636289000511, + "rewards/rejected": 0.04162780940532684, + "step": 8720 + }, + { + "epoch": 1.53, + "learning_rate": 5.677581863979849e-08, + "logits/chosen": -2.76914381980896, + "logits/rejected": -2.7731528282165527, + "logps/chosen": -239.4773406982422, + "logps/rejected": -220.02938842773438, + "loss": 0.6883, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.035095784813165665, + "rewards/margins": 0.004083072766661644, + "rewards/rejected": 0.031012708321213722, + "step": 8730 + }, + { + "epoch": 1.53, + "learning_rate": 5.6725440806045335e-08, + "logits/chosen": -2.8200926780700684, + "logits/rejected": -2.8051130771636963, + "logps/chosen": -225.9854278564453, + "logps/rejected": -199.87562561035156, + "loss": 0.6884, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.04804544523358345, + "rewards/margins": 0.0140976682305336, + "rewards/rejected": 0.03394777700304985, + "step": 8740 + }, + { + "epoch": 1.53, + "learning_rate": 5.667506297229219e-08, + "logits/chosen": -2.771458625793457, + "logits/rejected": -2.7316102981567383, + "logps/chosen": -198.54049682617188, + "logps/rejected": -189.3423614501953, + "loss": 0.6905, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0411757230758667, + "rewards/margins": 0.005958369933068752, + "rewards/rejected": 0.03521735221147537, + "step": 8750 + }, + { + "epoch": 1.53, + "learning_rate": 5.662468513853904e-08, + "logits/chosen": -2.7698636054992676, + "logits/rejected": -2.7552199363708496, + "logps/chosen": -229.97537231445312, + "logps/rejected": -203.84976196289062, + "loss": 0.6877, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.05870678275823593, + "rewards/margins": 0.017172252759337425, + "rewards/rejected": 0.04153453931212425, + "step": 8760 + }, + { + "epoch": 1.54, + "learning_rate": 5.6574307304785896e-08, + "logits/chosen": -2.6863961219787598, + "logits/rejected": -2.6779088973999023, + "logps/chosen": -234.57101440429688, + "logps/rejected": -185.58840942382812, + "loss": 0.6905, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.03976276144385338, + "rewards/margins": 0.00548075046390295, + "rewards/rejected": 0.034282006323337555, + "step": 8770 + }, + { + "epoch": 1.54, + "learning_rate": 5.6523929471032737e-08, + "logits/chosen": -2.739356517791748, + "logits/rejected": -2.788348436355591, + "logps/chosen": -209.69857788085938, + "logps/rejected": -199.63473510742188, + "loss": 0.6887, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.04317685216665268, + "rewards/margins": 0.006445699837058783, + "rewards/rejected": 0.03673115372657776, + "step": 8780 + }, + { + "epoch": 1.54, + "learning_rate": 5.647355163727959e-08, + "logits/chosen": -2.7598869800567627, + "logits/rejected": -2.738487482070923, + "logps/chosen": -249.5239715576172, + "logps/rejected": -210.69021606445312, + "loss": 0.6884, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.057052165269851685, + "rewards/margins": 0.014407709240913391, + "rewards/rejected": 0.04264445602893829, + "step": 8790 + }, + { + "epoch": 1.54, + "learning_rate": 5.6423173803526444e-08, + "logits/chosen": -2.7936174869537354, + "logits/rejected": -2.7623283863067627, + "logps/chosen": -206.39572143554688, + "logps/rejected": -162.04994201660156, + "loss": 0.6899, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.04691698029637337, + "rewards/margins": 0.015475709922611713, + "rewards/rejected": 0.03144126385450363, + "step": 8800 + }, + { + "epoch": 1.54, + "learning_rate": 5.6372795969773304e-08, + "logits/chosen": -2.7687063217163086, + "logits/rejected": -2.7901759147644043, + "logps/chosen": -271.50201416015625, + "logps/rejected": -216.03878784179688, + "loss": 0.6888, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.05467065051198006, + "rewards/margins": 0.01723630167543888, + "rewards/rejected": 0.03743434697389603, + "step": 8810 + }, + { + "epoch": 1.54, + "learning_rate": 5.6322418136020145e-08, + "logits/chosen": -2.794313430786133, + "logits/rejected": -2.794102191925049, + "logps/chosen": -233.6994171142578, + "logps/rejected": -184.6134033203125, + "loss": 0.6888, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.03926300257444382, + "rewards/margins": 0.001541120931506157, + "rewards/rejected": 0.03772187978029251, + "step": 8820 + }, + { + "epoch": 1.55, + "learning_rate": 5.6272040302267e-08, + "logits/chosen": -2.72084641456604, + "logits/rejected": -2.8114678859710693, + "logps/chosen": -229.1598663330078, + "logps/rejected": -197.14385986328125, + "loss": 0.6855, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.04723774269223213, + "rewards/margins": 0.010595154948532581, + "rewards/rejected": 0.036642588675022125, + "step": 8830 + }, + { + "epoch": 1.55, + "learning_rate": 5.622166246851385e-08, + "logits/chosen": -2.7159905433654785, + "logits/rejected": -2.7547850608825684, + "logps/chosen": -249.0121612548828, + "logps/rejected": -196.9223175048828, + "loss": 0.6863, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.05349539592862129, + "rewards/margins": 0.01618610881268978, + "rewards/rejected": 0.03730928525328636, + "step": 8840 + }, + { + "epoch": 1.55, + "learning_rate": 5.6171284634760705e-08, + "logits/chosen": -2.724531650543213, + "logits/rejected": -2.7724790573120117, + "logps/chosen": -231.1404571533203, + "logps/rejected": -227.45590209960938, + "loss": 0.689, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.04307236522436142, + "rewards/margins": 0.007877699099481106, + "rewards/rejected": 0.035194672644138336, + "step": 8850 + }, + { + "epoch": 1.55, + "learning_rate": 5.612090680100755e-08, + "logits/chosen": -2.754436731338501, + "logits/rejected": -2.8007025718688965, + "logps/chosen": -270.7969055175781, + "logps/rejected": -242.35183715820312, + "loss": 0.6872, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.05585699528455734, + "rewards/margins": 0.009231283329427242, + "rewards/rejected": 0.04662570729851723, + "step": 8860 + }, + { + "epoch": 1.55, + "learning_rate": 5.6070528967254406e-08, + "logits/chosen": -2.6838278770446777, + "logits/rejected": -2.766242265701294, + "logps/chosen": -255.3485565185547, + "logps/rejected": -220.1199188232422, + "loss": 0.6878, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.048295557498931885, + "rewards/margins": 0.009508052840828896, + "rewards/rejected": 0.03878750279545784, + "step": 8870 + }, + { + "epoch": 1.56, + "learning_rate": 5.602015113350126e-08, + "logits/chosen": -2.7382352352142334, + "logits/rejected": -2.8044495582580566, + "logps/chosen": -244.29153442382812, + "logps/rejected": -218.97097778320312, + "loss": 0.6876, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.05450066179037094, + "rewards/margins": 0.008315160870552063, + "rewards/rejected": 0.04618550091981888, + "step": 8880 + }, + { + "epoch": 1.56, + "learning_rate": 5.5969773299748113e-08, + "logits/chosen": -2.776350498199463, + "logits/rejected": -2.752664566040039, + "logps/chosen": -235.73233032226562, + "logps/rejected": -208.52737426757812, + "loss": 0.6874, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.04617000371217728, + "rewards/margins": 0.0013287483016029, + "rewards/rejected": 0.044841259717941284, + "step": 8890 + }, + { + "epoch": 1.56, + "learning_rate": 5.5919395465994954e-08, + "logits/chosen": -2.7392613887786865, + "logits/rejected": -2.756448268890381, + "logps/chosen": -219.9252166748047, + "logps/rejected": -183.68324279785156, + "loss": 0.6877, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.04604010656476021, + "rewards/margins": 0.004281000234186649, + "rewards/rejected": 0.041759099811315536, + "step": 8900 + }, + { + "epoch": 1.56, + "learning_rate": 5.586901763224181e-08, + "logits/chosen": -2.738739252090454, + "logits/rejected": -2.8169057369232178, + "logps/chosen": -252.9962158203125, + "logps/rejected": -200.0865936279297, + "loss": 0.6885, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.047353629022836685, + "rewards/margins": 0.00408762414008379, + "rewards/rejected": 0.04326600581407547, + "step": 8910 + }, + { + "epoch": 1.56, + "learning_rate": 5.581863979848867e-08, + "logits/chosen": -2.7649385929107666, + "logits/rejected": -2.733037233352661, + "logps/chosen": -203.55955505371094, + "logps/rejected": -200.595458984375, + "loss": 0.687, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.036483533680438995, + "rewards/margins": 0.010326062329113483, + "rewards/rejected": 0.026157474145293236, + "step": 8920 + }, + { + "epoch": 1.56, + "learning_rate": 5.576826196473552e-08, + "logits/chosen": -2.7592132091522217, + "logits/rejected": -2.7713820934295654, + "logps/chosen": -292.9085693359375, + "logps/rejected": -248.684814453125, + "loss": 0.6872, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.06435064971446991, + "rewards/margins": 0.020021168515086174, + "rewards/rejected": 0.04432948678731918, + "step": 8930 + }, + { + "epoch": 1.57, + "learning_rate": 5.571788413098236e-08, + "logits/chosen": -2.779628276824951, + "logits/rejected": -2.7205421924591064, + "logps/chosen": -201.10134887695312, + "logps/rejected": -219.69430541992188, + "loss": 0.6892, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.037483375519514084, + "rewards/margins": 0.004479845520108938, + "rewards/rejected": 0.03300352767109871, + "step": 8940 + }, + { + "epoch": 1.57, + "learning_rate": 5.5667506297229215e-08, + "logits/chosen": -2.7869956493377686, + "logits/rejected": -2.8030505180358887, + "logps/chosen": -224.43423461914062, + "logps/rejected": -202.8345184326172, + "loss": 0.6873, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.05292726680636406, + "rewards/margins": 0.013693466782569885, + "rewards/rejected": 0.039233800023794174, + "step": 8950 + }, + { + "epoch": 1.57, + "learning_rate": 5.561712846347607e-08, + "logits/chosen": -2.7221343517303467, + "logits/rejected": -2.7979655265808105, + "logps/chosen": -275.8337707519531, + "logps/rejected": -228.05105590820312, + "loss": 0.6862, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.05333739519119263, + "rewards/margins": 0.012456092052161694, + "rewards/rejected": 0.04088129848241806, + "step": 8960 + }, + { + "epoch": 1.57, + "learning_rate": 5.556675062972292e-08, + "logits/chosen": -2.7971296310424805, + "logits/rejected": -2.7281224727630615, + "logps/chosen": -217.47689819335938, + "logps/rejected": -214.9822235107422, + "loss": 0.6887, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.04712430015206337, + "rewards/margins": 0.0025797581765800714, + "rewards/rejected": 0.04454454034566879, + "step": 8970 + }, + { + "epoch": 1.57, + "learning_rate": 5.551637279596977e-08, + "logits/chosen": -2.710780382156372, + "logits/rejected": -2.772583484649658, + "logps/chosen": -215.26107788085938, + "logps/rejected": -197.31336975097656, + "loss": 0.6885, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.04553055018186569, + "rewards/margins": 0.0024104660842567682, + "rewards/rejected": 0.04312007874250412, + "step": 8980 + }, + { + "epoch": 1.57, + "learning_rate": 5.546599496221662e-08, + "logits/chosen": -2.8027522563934326, + "logits/rejected": -2.8064560890197754, + "logps/chosen": -245.5795135498047, + "logps/rejected": -193.53579711914062, + "loss": 0.6881, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.046005867421627045, + "rewards/margins": 0.012948085553944111, + "rewards/rejected": 0.03305777907371521, + "step": 8990 + }, + { + "epoch": 1.58, + "learning_rate": 5.541561712846348e-08, + "logits/chosen": -2.7577126026153564, + "logits/rejected": -2.7995660305023193, + "logps/chosen": -224.8982696533203, + "logps/rejected": -200.3507843017578, + "loss": 0.6894, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.050915975123643875, + "rewards/margins": 0.012286419048905373, + "rewards/rejected": 0.03862955421209335, + "step": 9000 + }, + { + "epoch": 1.58, + "learning_rate": 5.536523929471032e-08, + "logits/chosen": -2.725773334503174, + "logits/rejected": -2.7094340324401855, + "logps/chosen": -283.9950256347656, + "logps/rejected": -243.35842895507812, + "loss": 0.6876, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.06494607031345367, + "rewards/margins": 0.016711626201868057, + "rewards/rejected": 0.048234451562166214, + "step": 9010 + }, + { + "epoch": 1.58, + "learning_rate": 5.531486146095717e-08, + "logits/chosen": -2.817140579223633, + "logits/rejected": -2.810319423675537, + "logps/chosen": -226.22549438476562, + "logps/rejected": -191.5854949951172, + "loss": 0.6871, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.061543893069028854, + "rewards/margins": 0.025458836928009987, + "rewards/rejected": 0.03608505055308342, + "step": 9020 + }, + { + "epoch": 1.58, + "learning_rate": 5.526448362720403e-08, + "logits/chosen": -2.779113531112671, + "logits/rejected": -2.7687220573425293, + "logps/chosen": -229.80224609375, + "logps/rejected": -204.94235229492188, + "loss": 0.6867, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.05384296923875809, + "rewards/margins": 0.02316504344344139, + "rewards/rejected": 0.03067792020738125, + "step": 9030 + }, + { + "epoch": 1.58, + "learning_rate": 5.5214105793450885e-08, + "logits/chosen": -2.736494779586792, + "logits/rejected": -2.705517053604126, + "logps/chosen": -232.3329315185547, + "logps/rejected": -209.12216186523438, + "loss": 0.689, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.05568603798747063, + "rewards/margins": 0.011279943399131298, + "rewards/rejected": 0.04440609738230705, + "step": 9040 + }, + { + "epoch": 1.59, + "learning_rate": 5.5163727959697725e-08, + "logits/chosen": -2.800626039505005, + "logits/rejected": -2.7749905586242676, + "logps/chosen": -227.7764892578125, + "logps/rejected": -180.96810913085938, + "loss": 0.6876, + "rewards/accuracies": 0.7749999761581421, + "rewards/chosen": 0.04726389795541763, + "rewards/margins": 0.020383086055517197, + "rewards/rejected": 0.02688080631196499, + "step": 9050 + }, + { + "epoch": 1.59, + "learning_rate": 5.511335012594458e-08, + "logits/chosen": -2.699848175048828, + "logits/rejected": -2.845942974090576, + "logps/chosen": -298.18463134765625, + "logps/rejected": -216.5264129638672, + "loss": 0.6855, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.058933716267347336, + "rewards/margins": 0.012239878997206688, + "rewards/rejected": 0.0466938316822052, + "step": 9060 + }, + { + "epoch": 1.59, + "learning_rate": 5.506297229219143e-08, + "logits/chosen": -2.8089985847473145, + "logits/rejected": -2.822813034057617, + "logps/chosen": -233.1894073486328, + "logps/rejected": -217.60147094726562, + "loss": 0.6879, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.05084647610783577, + "rewards/margins": 0.004182029515504837, + "rewards/rejected": 0.04666444659233093, + "step": 9070 + }, + { + "epoch": 1.59, + "learning_rate": 5.5012594458438286e-08, + "logits/chosen": -2.7646870613098145, + "logits/rejected": -2.7673144340515137, + "logps/chosen": -224.1854705810547, + "logps/rejected": -191.7845001220703, + "loss": 0.6873, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.0356200747191906, + "rewards/margins": 0.013415751047432423, + "rewards/rejected": 0.0222043227404356, + "step": 9080 + }, + { + "epoch": 1.59, + "learning_rate": 5.496221662468513e-08, + "logits/chosen": -2.754457950592041, + "logits/rejected": -2.818115472793579, + "logps/chosen": -299.34967041015625, + "logps/rejected": -258.12750244140625, + "loss": 0.6896, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.06361515820026398, + "rewards/margins": 0.019738245755434036, + "rewards/rejected": 0.04387691244482994, + "step": 9090 + }, + { + "epoch": 1.59, + "learning_rate": 5.491183879093199e-08, + "logits/chosen": -2.8182778358459473, + "logits/rejected": -2.8445849418640137, + "logps/chosen": -233.5463104248047, + "logps/rejected": -215.1799774169922, + "loss": 0.6886, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.043782927095890045, + "rewards/margins": 0.010205776430666447, + "rewards/rejected": 0.033577147871255875, + "step": 9100 + }, + { + "epoch": 1.6, + "learning_rate": 5.486146095717884e-08, + "logits/chosen": -2.8396553993225098, + "logits/rejected": -2.7761013507843018, + "logps/chosen": -244.1826934814453, + "logps/rejected": -222.1802520751953, + "loss": 0.6872, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.05905939266085625, + "rewards/margins": 0.010740868747234344, + "rewards/rejected": 0.0483185239136219, + "step": 9110 + }, + { + "epoch": 1.6, + "learning_rate": 5.4811083123425694e-08, + "logits/chosen": -2.8012256622314453, + "logits/rejected": -2.7701072692871094, + "logps/chosen": -203.14297485351562, + "logps/rejected": -186.69833374023438, + "loss": 0.6888, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.041209183633327484, + "rewards/margins": 0.008670704439282417, + "rewards/rejected": 0.032538481056690216, + "step": 9120 + }, + { + "epoch": 1.6, + "learning_rate": 5.4760705289672534e-08, + "logits/chosen": -2.8059725761413574, + "logits/rejected": -2.7879891395568848, + "logps/chosen": -237.21102905273438, + "logps/rejected": -198.75558471679688, + "loss": 0.6877, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04212053492665291, + "rewards/margins": 0.011806664988398552, + "rewards/rejected": 0.03031386435031891, + "step": 9130 + }, + { + "epoch": 1.6, + "learning_rate": 5.4710327455919395e-08, + "logits/chosen": -2.696505069732666, + "logits/rejected": -2.685786724090576, + "logps/chosen": -177.89352416992188, + "logps/rejected": -178.42393493652344, + "loss": 0.6902, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03737228736281395, + "rewards/margins": 0.0012526328209787607, + "rewards/rejected": 0.03611965477466583, + "step": 9140 + }, + { + "epoch": 1.6, + "learning_rate": 5.465994962216625e-08, + "logits/chosen": -2.761359691619873, + "logits/rejected": -2.7841641902923584, + "logps/chosen": -248.031982421875, + "logps/rejected": -212.16357421875, + "loss": 0.6866, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.05025426670908928, + "rewards/margins": 0.013314127922058105, + "rewards/rejected": 0.03694014251232147, + "step": 9150 + }, + { + "epoch": 1.6, + "learning_rate": 5.46095717884131e-08, + "logits/chosen": -2.7705512046813965, + "logits/rejected": -2.7175521850585938, + "logps/chosen": -218.7301483154297, + "logps/rejected": -175.79981994628906, + "loss": 0.6895, + "rewards/accuracies": 0.699999988079071, + "rewards/chosen": 0.0510282889008522, + "rewards/margins": 0.02606021985411644, + "rewards/rejected": 0.024968067184090614, + "step": 9160 + }, + { + "epoch": 1.61, + "learning_rate": 5.455919395465994e-08, + "logits/chosen": -2.6632533073425293, + "logits/rejected": -2.736161470413208, + "logps/chosen": -239.3765411376953, + "logps/rejected": -227.0360870361328, + "loss": 0.6887, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.03844603896141052, + "rewards/margins": 0.0018884660676121712, + "rewards/rejected": 0.036557577550411224, + "step": 9170 + }, + { + "epoch": 1.61, + "learning_rate": 5.4508816120906796e-08, + "logits/chosen": -2.732358455657959, + "logits/rejected": -2.7481753826141357, + "logps/chosen": -211.608154296875, + "logps/rejected": -191.95108032226562, + "loss": 0.6872, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.04012041911482811, + "rewards/margins": 0.0042021796107292175, + "rewards/rejected": 0.03591823950409889, + "step": 9180 + }, + { + "epoch": 1.61, + "learning_rate": 5.445843828715365e-08, + "logits/chosen": -2.7956507205963135, + "logits/rejected": -2.782504081726074, + "logps/chosen": -259.437744140625, + "logps/rejected": -203.3538055419922, + "loss": 0.6885, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.05651463195681572, + "rewards/margins": 0.015020245686173439, + "rewards/rejected": 0.04149438813328743, + "step": 9190 + }, + { + "epoch": 1.61, + "learning_rate": 5.44080604534005e-08, + "logits/chosen": -2.7223739624023438, + "logits/rejected": -2.7335617542266846, + "logps/chosen": -247.673828125, + "logps/rejected": -217.86328125, + "loss": 0.6876, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.05414513498544693, + "rewards/margins": 0.009823627769947052, + "rewards/rejected": 0.044321510940790176, + "step": 9200 + }, + { + "epoch": 1.61, + "learning_rate": 5.435768261964735e-08, + "logits/chosen": -2.748483419418335, + "logits/rejected": -2.700045108795166, + "logps/chosen": -252.93405151367188, + "logps/rejected": -234.80014038085938, + "loss": 0.6874, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.05770406126976013, + "rewards/margins": 0.012363392859697342, + "rewards/rejected": 0.04534066468477249, + "step": 9210 + }, + { + "epoch": 1.61, + "learning_rate": 5.4307304785894204e-08, + "logits/chosen": -2.8123254776000977, + "logits/rejected": -2.8114287853240967, + "logps/chosen": -220.3101348876953, + "logps/rejected": -190.74180603027344, + "loss": 0.6863, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.05203206464648247, + "rewards/margins": 0.0164670217782259, + "rewards/rejected": 0.03556504473090172, + "step": 9220 + }, + { + "epoch": 1.62, + "learning_rate": 5.425692695214106e-08, + "logits/chosen": -2.6993188858032227, + "logits/rejected": -2.698683023452759, + "logps/chosen": -224.6380157470703, + "logps/rejected": -183.78054809570312, + "loss": 0.6897, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.029758159071207047, + "rewards/margins": 0.004012234043329954, + "rewards/rejected": 0.025745924562215805, + "step": 9230 + }, + { + "epoch": 1.62, + "learning_rate": 5.420654911838791e-08, + "logits/chosen": -2.7783288955688477, + "logits/rejected": -2.765300750732422, + "logps/chosen": -257.1777038574219, + "logps/rejected": -236.02853393554688, + "loss": 0.6866, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.053491055965423584, + "rewards/margins": 0.011988423764705658, + "rewards/rejected": 0.041502632200717926, + "step": 9240 + }, + { + "epoch": 1.62, + "learning_rate": 5.415617128463476e-08, + "logits/chosen": -2.6956281661987305, + "logits/rejected": -2.711439371109009, + "logps/chosen": -221.18392944335938, + "logps/rejected": -181.74325561523438, + "loss": 0.6883, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0465092733502388, + "rewards/margins": 0.013767106458544731, + "rewards/rejected": 0.03274216502904892, + "step": 9250 + }, + { + "epoch": 1.62, + "learning_rate": 5.410579345088161e-08, + "logits/chosen": -2.6863269805908203, + "logits/rejected": -2.678377866744995, + "logps/chosen": -221.8884735107422, + "logps/rejected": -234.8877410888672, + "loss": 0.687, + "rewards/accuracies": 0.4000000059604645, + "rewards/chosen": 0.03930746018886566, + "rewards/margins": -0.004805571865290403, + "rewards/rejected": 0.04411303251981735, + "step": 9260 + }, + { + "epoch": 1.62, + "learning_rate": 5.4055415617128465e-08, + "logits/chosen": -2.704188585281372, + "logits/rejected": -2.7121920585632324, + "logps/chosen": -180.83108520507812, + "logps/rejected": -161.4171600341797, + "loss": 0.6877, + "rewards/accuracies": 0.44999998807907104, + "rewards/chosen": 0.030211174860596657, + "rewards/margins": 0.0018332020845264196, + "rewards/rejected": 0.028377970680594444, + "step": 9270 + }, + { + "epoch": 1.63, + "learning_rate": 5.400503778337532e-08, + "logits/chosen": -2.750490665435791, + "logits/rejected": -2.709672451019287, + "logps/chosen": -181.82015991210938, + "logps/rejected": -176.56161499023438, + "loss": 0.6884, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.0316244475543499, + "rewards/margins": 0.004817810840904713, + "rewards/rejected": 0.02680664137005806, + "step": 9280 + }, + { + "epoch": 1.63, + "learning_rate": 5.395465994962216e-08, + "logits/chosen": -2.706376075744629, + "logits/rejected": -2.684630870819092, + "logps/chosen": -205.58694458007812, + "logps/rejected": -169.49627685546875, + "loss": 0.6898, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.03486959636211395, + "rewards/margins": 0.010895296931266785, + "rewards/rejected": 0.023974299430847168, + "step": 9290 + }, + { + "epoch": 1.63, + "learning_rate": 5.390428211586901e-08, + "logits/chosen": -2.7642054557800293, + "logits/rejected": -2.686594009399414, + "logps/chosen": -209.44400024414062, + "logps/rejected": -176.10757446289062, + "loss": 0.6888, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.0430467426776886, + "rewards/margins": 0.012011488899588585, + "rewards/rejected": 0.031035255640745163, + "step": 9300 + }, + { + "epoch": 1.63, + "learning_rate": 5.385390428211587e-08, + "logits/chosen": -2.851130962371826, + "logits/rejected": -2.8562734127044678, + "logps/chosen": -215.0302734375, + "logps/rejected": -205.55197143554688, + "loss": 0.6896, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.047839634120464325, + "rewards/margins": 0.004748721607029438, + "rewards/rejected": 0.04309091344475746, + "step": 9310 + }, + { + "epoch": 1.63, + "learning_rate": 5.3803526448362714e-08, + "logits/chosen": -2.815729856491089, + "logits/rejected": -2.8203251361846924, + "logps/chosen": -228.56088256835938, + "logps/rejected": -225.7352752685547, + "loss": 0.6898, + "rewards/accuracies": 0.550000011920929, + "rewards/chosen": 0.047780029475688934, + "rewards/margins": 0.0014233911642804742, + "rewards/rejected": 0.04635664075613022, + "step": 9320 + }, + { + "epoch": 1.63, + "learning_rate": 5.375314861460957e-08, + "logits/chosen": -2.782745838165283, + "logits/rejected": -2.772181510925293, + "logps/chosen": -271.4385070800781, + "logps/rejected": -241.4732208251953, + "loss": 0.6889, + "rewards/accuracies": 0.6499999761581421, + "rewards/chosen": 0.06021879240870476, + "rewards/margins": 0.013006770983338356, + "rewards/rejected": 0.04721202328801155, + "step": 9330 + }, + { + "epoch": 1.64, + "learning_rate": 5.370277078085642e-08, + "logits/chosen": -2.7766032218933105, + "logits/rejected": -2.708247661590576, + "logps/chosen": -223.17605590820312, + "logps/rejected": -180.75387573242188, + "loss": 0.688, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.04519111290574074, + "rewards/margins": 0.013616492971777916, + "rewards/rejected": 0.03157461807131767, + "step": 9340 + }, + { + "epoch": 1.64, + "learning_rate": 5.3652392947103275e-08, + "logits/chosen": -2.7174108028411865, + "logits/rejected": -2.7053213119506836, + "logps/chosen": -200.68690490722656, + "logps/rejected": -192.92942810058594, + "loss": 0.6858, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.03941025584936142, + "rewards/margins": 0.0023084853310137987, + "rewards/rejected": 0.03710177168250084, + "step": 9350 + }, + { + "epoch": 1.64, + "learning_rate": 5.360201511335012e-08, + "logits/chosen": -2.7744853496551514, + "logits/rejected": -2.7775588035583496, + "logps/chosen": -230.5467529296875, + "logps/rejected": -145.92202758789062, + "loss": 0.6877, + "rewards/accuracies": 0.824999988079071, + "rewards/chosen": 0.057361818850040436, + "rewards/margins": 0.030046069994568825, + "rewards/rejected": 0.02731575071811676, + "step": 9360 + }, + { + "epoch": 1.64, + "learning_rate": 5.3551637279596975e-08, + "logits/chosen": -2.803952693939209, + "logits/rejected": -2.676877975463867, + "logps/chosen": -189.181884765625, + "logps/rejected": -245.7015838623047, + "loss": 0.6888, + "rewards/accuracies": 0.5, + "rewards/chosen": 0.0401124581694603, + "rewards/margins": -0.004306624177843332, + "rewards/rejected": 0.04441908746957779, + "step": 9370 + }, + { + "epoch": 1.64, + "learning_rate": 5.350125944584383e-08, + "logits/chosen": -2.7858364582061768, + "logits/rejected": -2.7707884311676025, + "logps/chosen": -211.93972778320312, + "logps/rejected": -190.19741821289062, + "loss": 0.6889, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.03734724968671799, + "rewards/margins": 0.0010033950675278902, + "rewards/rejected": 0.03634385019540787, + "step": 9380 + }, + { + "epoch": 1.64, + "learning_rate": 5.345088161209068e-08, + "logits/chosen": -2.7639200687408447, + "logits/rejected": -2.776536703109741, + "logps/chosen": -227.98196411132812, + "logps/rejected": -218.516845703125, + "loss": 0.6885, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.045007266104221344, + "rewards/margins": 0.007175090257078409, + "rewards/rejected": 0.03783217817544937, + "step": 9390 + }, + { + "epoch": 1.65, + "learning_rate": 5.340050377833752e-08, + "logits/chosen": -2.728909969329834, + "logits/rejected": -2.7919864654541016, + "logps/chosen": -263.0089416503906, + "logps/rejected": -209.14541625976562, + "loss": 0.6875, + "rewards/accuracies": 0.875, + "rewards/chosen": 0.07431508600711823, + "rewards/margins": 0.02915819361805916, + "rewards/rejected": 0.045156896114349365, + "step": 9400 + }, + { + "epoch": 1.65, + "learning_rate": 5.3350125944584377e-08, + "logits/chosen": -2.732649564743042, + "logits/rejected": -2.6923861503601074, + "logps/chosen": -239.49832153320312, + "logps/rejected": -213.4709014892578, + "loss": 0.6869, + "rewards/accuracies": 0.675000011920929, + "rewards/chosen": 0.05820096284151077, + "rewards/margins": 0.018569031730294228, + "rewards/rejected": 0.0396319255232811, + "step": 9410 + }, + { + "epoch": 1.65, + "learning_rate": 5.329974811083123e-08, + "logits/chosen": -2.7434606552124023, + "logits/rejected": -2.7499537467956543, + "logps/chosen": -261.1266784667969, + "logps/rejected": -205.405029296875, + "loss": 0.6876, + "rewards/accuracies": 0.6000000238418579, + "rewards/chosen": 0.06213949993252754, + "rewards/margins": 0.024112531915307045, + "rewards/rejected": 0.03802696242928505, + "step": 9420 + }, + { + "epoch": 1.65, + "learning_rate": 5.324937027707809e-08, + "logits/chosen": -2.7199864387512207, + "logits/rejected": -2.798959970474243, + "logps/chosen": -249.7239990234375, + "logps/rejected": -202.08853149414062, + "loss": 0.6867, + "rewards/accuracies": 0.574999988079071, + "rewards/chosen": 0.0552804172039032, + "rewards/margins": 0.010709071531891823, + "rewards/rejected": 0.044571347534656525, + "step": 9430 + }, + { + "epoch": 1.65, + "learning_rate": 5.319899244332493e-08, + "logits/chosen": -2.7173819541931152, + "logits/rejected": -2.7432703971862793, + "logps/chosen": -216.4027557373047, + "logps/rejected": -190.73458862304688, + "loss": 0.691, + "rewards/accuracies": 0.42500001192092896, + "rewards/chosen": 0.04708380252122879, + "rewards/margins": -0.0027190011460334063, + "rewards/rejected": 0.049802809953689575, + "step": 9440 + }, + { + "epoch": 1.66, + "learning_rate": 5.3148614609571785e-08, + "logits/chosen": -2.7633492946624756, + "logits/rejected": -2.704305410385132, + "logps/chosen": -260.4012756347656, + "logps/rejected": -246.67404174804688, + "loss": 0.6874, + "rewards/accuracies": 0.4749999940395355, + "rewards/chosen": 0.05863087251782417, + "rewards/margins": 0.00220307894051075, + "rewards/rejected": 0.05642779916524887, + "step": 9450 + }, + { + "epoch": 1.66, + "learning_rate": 5.309823677581864e-08, + "logits/chosen": -2.7123265266418457, + "logits/rejected": -2.729973077774048, + "logps/chosen": -227.2530975341797, + "logps/rejected": -269.09375, + "loss": 0.6884, + "rewards/accuracies": 0.5249999761581421, + "rewards/chosen": 0.04649816080927849, + "rewards/margins": -0.0020359910558909178, + "rewards/rejected": 0.048534151166677475, + "step": 9460 + }, + { + "epoch": 1.66, + "learning_rate": 5.304785894206549e-08, + "logits/chosen": -2.8059744834899902, + "logits/rejected": -2.8446147441864014, + "logps/chosen": -240.58425903320312, + "logps/rejected": -197.65289306640625, + "loss": 0.6862, + "rewards/accuracies": 0.625, + "rewards/chosen": 0.059047769755125046, + "rewards/margins": 0.01563527248799801, + "rewards/rejected": 0.04341249540448189, + "step": 9470 + }, + { + "epoch": 1.66, + "learning_rate": 5.299748110831234e-08, + "logits/chosen": -2.7589809894561768, + "logits/rejected": -2.745276927947998, + "logps/chosen": -252.64474487304688, + "logps/rejected": -227.1024169921875, + "loss": 0.6877, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.04754466563463211, + "rewards/margins": 0.012337127700448036, + "rewards/rejected": 0.035207539796829224, + "step": 9480 + }, + { + "epoch": 1.66, + "learning_rate": 5.294710327455919e-08, + "logits/chosen": -2.742103099822998, + "logits/rejected": -2.6979806423187256, + "logps/chosen": -221.4449462890625, + "logps/rejected": -201.50653076171875, + "loss": 0.6872, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.0446447879076004, + "rewards/margins": 0.01715948060154915, + "rewards/rejected": 0.027485307306051254, + "step": 9490 + }, + { + "epoch": 1.66, + "learning_rate": 5.2896725440806046e-08, + "logits/chosen": -2.774909734725952, + "logits/rejected": -2.7038991451263428, + "logps/chosen": -258.15899658203125, + "logps/rejected": -182.76722717285156, + "loss": 0.6852, + "rewards/accuracies": 0.7250000238418579, + "rewards/chosen": 0.056605808436870575, + "rewards/margins": 0.020097170025110245, + "rewards/rejected": 0.036508649587631226, + "step": 9500 + } + ], + "logging_steps": 10, + "max_steps": 20000, + "num_train_epochs": 4, + "save_steps": 500, + "total_flos": 0.0, + "trial_name": null, + "trial_params": null +}