{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 50, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.02, "grad_norm": 6.336705207824707, "learning_rate": 4.5e-06, "logits/chosen": 0.2884472906589508, "logits/rejected": 0.40965142846107483, "logps/chosen": -355.646728515625, "logps/rejected": -305.0962219238281, "loss": 0.6936, "rewards/accuracies": 0.4000000059604645, "rewards/chosen": 0.0013779326109215617, "rewards/margins": -0.0006383258732967079, "rewards/rejected": 0.0020162579603493214, "step": 10 }, { "epoch": 0.04, "grad_norm": 6.066710472106934, "learning_rate": 9.5e-06, "logits/chosen": 0.14486190676689148, "logits/rejected": 0.27484434843063354, "logps/chosen": -345.3768005371094, "logps/rejected": -362.3075866699219, "loss": 0.6939, "rewards/accuracies": 0.4833333492279053, "rewards/chosen": 0.011982182040810585, "rewards/margins": -0.0012166720116510987, "rewards/rejected": 0.01319885440170765, "step": 20 }, { "epoch": 0.06, "grad_norm": 4.703575611114502, "learning_rate": 1.45e-05, "logits/chosen": 0.10680116713047028, "logits/rejected": -0.018802711740136147, "logps/chosen": -325.0574951171875, "logps/rejected": -256.40966796875, "loss": 0.6926, "rewards/accuracies": 0.5666666626930237, "rewards/chosen": 0.023517221212387085, "rewards/margins": 0.0013313140952959657, "rewards/rejected": 0.022185906767845154, "step": 30 }, { "epoch": 0.08, "grad_norm": 5.95698881149292, "learning_rate": 1.9500000000000003e-05, "logits/chosen": 0.23321613669395447, "logits/rejected": 0.29815709590911865, "logps/chosen": -414.88934326171875, "logps/rejected": -364.77337646484375, "loss": 0.6867, "rewards/accuracies": 0.5333333611488342, "rewards/chosen": 0.08108480274677277, "rewards/margins": 0.01509697176516056, "rewards/rejected": 0.06598783284425735, "step": 40 }, { "epoch": 0.1, "grad_norm": 6.212809085845947, "learning_rate": 2.45e-05, "logits/chosen": 0.05829133838415146, "logits/rejected": 0.26185548305511475, "logps/chosen": -376.5933532714844, "logps/rejected": -321.00665283203125, "loss": 0.6879, "rewards/accuracies": 0.550000011920929, "rewards/chosen": 0.11275690793991089, "rewards/margins": 0.012456582859158516, "rewards/rejected": 0.10030031204223633, "step": 50 }, { "epoch": 0.1, "eval_logits/chosen": 0.037971604615449905, "eval_logits/rejected": 0.29195430874824524, "eval_logps/chosen": -384.281005859375, "eval_logps/rejected": -340.8085021972656, "eval_loss": 0.6827343106269836, "eval_rewards/accuracies": 0.5526315569877625, "eval_rewards/chosen": 0.17324700951576233, "eval_rewards/margins": 0.028422411531209946, "eval_rewards/rejected": 0.1448245793581009, "eval_runtime": 111.1391, "eval_samples_per_second": 2.699, "eval_steps_per_second": 0.342, "step": 50 }, { "epoch": 0.12, "grad_norm": 6.0398640632629395, "learning_rate": 2.95e-05, "logits/chosen": -0.11122157424688339, "logits/rejected": -0.00746047031134367, "logps/chosen": -408.02142333984375, "logps/rejected": -358.9617614746094, "loss": 0.6761, "rewards/accuracies": 0.5833333134651184, "rewards/chosen": 0.2293107807636261, "rewards/margins": 0.041216298937797546, "rewards/rejected": 0.18809448182582855, "step": 60 }, { "epoch": 0.14, "grad_norm": 7.345890998840332, "learning_rate": 3.45e-05, "logits/chosen": 0.24562212824821472, "logits/rejected": 0.27121594548225403, "logps/chosen": -431.5135803222656, "logps/rejected": -357.45062255859375, "loss": 0.6816, "rewards/accuracies": 0.5833333730697632, "rewards/chosen": 0.36051273345947266, "rewards/margins": 0.04433435946702957, "rewards/rejected": 0.3161783814430237, "step": 70 }, { "epoch": 0.16, "grad_norm": 5.378597736358643, "learning_rate": 3.9500000000000005e-05, "logits/chosen": -0.055510133504867554, "logits/rejected": 0.06074449419975281, "logps/chosen": -349.5056457519531, "logps/rejected": -298.19189453125, "loss": 0.6674, "rewards/accuracies": 0.5166666507720947, "rewards/chosen": 0.4240848124027252, "rewards/margins": 0.0907500609755516, "rewards/rejected": 0.333334743976593, "step": 80 }, { "epoch": 0.18, "grad_norm": 5.009306907653809, "learning_rate": 4.4500000000000004e-05, "logits/chosen": 0.460761696100235, "logits/rejected": 0.3970041871070862, "logps/chosen": -343.3364562988281, "logps/rejected": -346.8429870605469, "loss": 0.6964, "rewards/accuracies": 0.5666666626930237, "rewards/chosen": 0.4095408320426941, "rewards/margins": 0.03334635868668556, "rewards/rejected": 0.37619444727897644, "step": 90 }, { "epoch": 0.2, "grad_norm": 6.515726089477539, "learning_rate": 4.9500000000000004e-05, "logits/chosen": 0.10559816658496857, "logits/rejected": 0.21364697813987732, "logps/chosen": -418.237060546875, "logps/rejected": -369.6095275878906, "loss": 0.6765, "rewards/accuracies": 0.5666666626930237, "rewards/chosen": 0.40842658281326294, "rewards/margins": 0.059928763657808304, "rewards/rejected": 0.34849780797958374, "step": 100 }, { "epoch": 0.2, "eval_logits/chosen": 0.06404649466276169, "eval_logits/rejected": 0.307973176240921, "eval_logps/chosen": -382.68243408203125, "eval_logps/rejected": -339.8092041015625, "eval_loss": 0.6607274413108826, "eval_rewards/accuracies": 0.6414473652839661, "eval_rewards/chosen": 0.33310821652412415, "eval_rewards/margins": 0.08835449069738388, "eval_rewards/rejected": 0.24475376307964325, "eval_runtime": 110.7672, "eval_samples_per_second": 2.708, "eval_steps_per_second": 0.343, "step": 100 }, { "epoch": 0.22, "grad_norm": 5.3176984786987305, "learning_rate": 4.8875e-05, "logits/chosen": 0.2970436215400696, "logits/rejected": 0.26611050963401794, "logps/chosen": -400.3771667480469, "logps/rejected": -406.6891174316406, "loss": 0.7081, "rewards/accuracies": 0.4166666567325592, "rewards/chosen": 0.19517870247364044, "rewards/margins": -0.013467788696289062, "rewards/rejected": 0.2086464911699295, "step": 110 }, { "epoch": 0.24, "grad_norm": 7.095144271850586, "learning_rate": 4.7625000000000006e-05, "logits/chosen": -0.06270237267017365, "logits/rejected": 0.049232300370931625, "logps/chosen": -377.08111572265625, "logps/rejected": -326.0290832519531, "loss": 0.687, "rewards/accuracies": 0.6000000238418579, "rewards/chosen": -0.038210123777389526, "rewards/margins": 0.03700611740350723, "rewards/rejected": -0.07521622627973557, "step": 120 }, { "epoch": 0.26, "grad_norm": 5.485899925231934, "learning_rate": 4.6375e-05, "logits/chosen": 0.2947315573692322, "logits/rejected": 0.30565229058265686, "logps/chosen": -432.36138916015625, "logps/rejected": -352.40203857421875, "loss": 0.6736, "rewards/accuracies": 0.699999988079071, "rewards/chosen": 0.17748937010765076, "rewards/margins": 0.07449595630168915, "rewards/rejected": 0.1029934287071228, "step": 130 }, { "epoch": 0.28, "grad_norm": 7.982489109039307, "learning_rate": 4.5125e-05, "logits/chosen": 0.22027187049388885, "logits/rejected": 0.12688283622264862, "logps/chosen": -400.2425842285156, "logps/rejected": -338.5372009277344, "loss": 0.6942, "rewards/accuracies": 0.5166666507720947, "rewards/chosen": 0.52669757604599, "rewards/margins": 0.03541693836450577, "rewards/rejected": 0.4912806451320648, "step": 140 }, { "epoch": 0.3, "grad_norm": 4.92340612411499, "learning_rate": 4.3875e-05, "logits/chosen": 0.4400368332862854, "logits/rejected": 0.6112634539604187, "logps/chosen": -373.4757995605469, "logps/rejected": -313.86419677734375, "loss": 0.6812, "rewards/accuracies": 0.5500000715255737, "rewards/chosen": 0.6615363955497742, "rewards/margins": 0.07090020179748535, "rewards/rejected": 0.590636134147644, "step": 150 }, { "epoch": 0.3, "eval_logits/chosen": 0.18306924402713776, "eval_logits/rejected": 0.41837078332901, "eval_logps/chosen": -377.95928955078125, "eval_logps/rejected": -335.8048400878906, "eval_loss": 0.6639418601989746, "eval_rewards/accuracies": 0.5921052694320679, "eval_rewards/chosen": 0.8054203391075134, "eval_rewards/margins": 0.16022570431232452, "eval_rewards/rejected": 0.6451946496963501, "eval_runtime": 110.7635, "eval_samples_per_second": 2.708, "eval_steps_per_second": 0.343, "step": 150 }, { "epoch": 0.32, "grad_norm": 5.507699489593506, "learning_rate": 4.2625000000000006e-05, "logits/chosen": 0.06238343566656113, "logits/rejected": 0.2610507011413574, "logps/chosen": -354.340576171875, "logps/rejected": -313.094482421875, "loss": 0.6718, "rewards/accuracies": 0.44999998807907104, "rewards/chosen": 0.7900612354278564, "rewards/margins": 0.11699613183736801, "rewards/rejected": 0.6730651259422302, "step": 160 }, { "epoch": 0.34, "grad_norm": 5.172399997711182, "learning_rate": 4.1375e-05, "logits/chosen": 0.14939634501934052, "logits/rejected": 0.008766859769821167, "logps/chosen": -388.7623291015625, "logps/rejected": -325.0237731933594, "loss": 0.6338, "rewards/accuracies": 0.5833333730697632, "rewards/chosen": 0.9776442646980286, "rewards/margins": 0.25690537691116333, "rewards/rejected": 0.7207388877868652, "step": 170 }, { "epoch": 0.36, "grad_norm": 9.718168258666992, "learning_rate": 4.0125e-05, "logits/chosen": 0.14167270064353943, "logits/rejected": 0.18558117747306824, "logps/chosen": -312.6748046875, "logps/rejected": -317.16265869140625, "loss": 0.739, "rewards/accuracies": 0.5166666507720947, "rewards/chosen": 0.5937276482582092, "rewards/margins": -0.014927273616194725, "rewards/rejected": 0.6086549162864685, "step": 180 }, { "epoch": 0.38, "grad_norm": 4.4349751472473145, "learning_rate": 3.8875e-05, "logits/chosen": -0.034669190645217896, "logits/rejected": 0.22868581116199493, "logps/chosen": -349.32037353515625, "logps/rejected": -321.3941955566406, "loss": 0.6525, "rewards/accuracies": 0.6000000238418579, "rewards/chosen": 0.5615012645721436, "rewards/margins": 0.1495741307735443, "rewards/rejected": 0.41192713379859924, "step": 190 }, { "epoch": 0.4, "grad_norm": 6.693329811096191, "learning_rate": 3.7625e-05, "logits/chosen": 0.15313725173473358, "logits/rejected": 0.11542512476444244, "logps/chosen": -438.50701904296875, "logps/rejected": -376.7723388671875, "loss": 0.6622, "rewards/accuracies": 0.6499999761581421, "rewards/chosen": 0.4796217978000641, "rewards/margins": 0.11786258220672607, "rewards/rejected": 0.3617592453956604, "step": 200 }, { "epoch": 0.4, "eval_logits/chosen": 0.07203032821416855, "eval_logits/rejected": 0.2990891635417938, "eval_logps/chosen": -381.4584045410156, "eval_logps/rejected": -339.5525207519531, "eval_loss": 0.6342300772666931, "eval_rewards/accuracies": 0.6776315569877625, "eval_rewards/chosen": 0.45550742745399475, "eval_rewards/margins": 0.18508483469486237, "eval_rewards/rejected": 0.2704225778579712, "eval_runtime": 110.7746, "eval_samples_per_second": 2.708, "eval_steps_per_second": 0.343, "step": 200 }, { "epoch": 0.42, "grad_norm": 5.154126167297363, "learning_rate": 3.6375e-05, "logits/chosen": 0.14750126004219055, "logits/rejected": 0.3790293335914612, "logps/chosen": -354.99249267578125, "logps/rejected": -334.5828857421875, "loss": 0.6564, "rewards/accuracies": 0.6166666746139526, "rewards/chosen": 0.4125402569770813, "rewards/margins": 0.1406583935022354, "rewards/rejected": 0.2718818485736847, "step": 210 }, { "epoch": 0.44, "grad_norm": 6.265260696411133, "learning_rate": 3.5125e-05, "logits/chosen": 0.15185442566871643, "logits/rejected": 0.2718904912471771, "logps/chosen": -410.98809814453125, "logps/rejected": -363.15625, "loss": 0.6678, "rewards/accuracies": 0.6166666746139526, "rewards/chosen": 0.6292893290519714, "rewards/margins": 0.11445705592632294, "rewards/rejected": 0.5148323178291321, "step": 220 }, { "epoch": 0.46, "grad_norm": 4.842378616333008, "learning_rate": 3.3875000000000003e-05, "logits/chosen": 0.0003437995910644531, "logits/rejected": 0.03505432978272438, "logps/chosen": -397.8294372558594, "logps/rejected": -355.87109375, "loss": 0.6957, "rewards/accuracies": 0.550000011920929, "rewards/chosen": 0.8057634234428406, "rewards/margins": 0.10026631504297256, "rewards/rejected": 0.705497145652771, "step": 230 }, { "epoch": 0.48, "grad_norm": 4.746981620788574, "learning_rate": 3.2625e-05, "logits/chosen": 0.12059871107339859, "logits/rejected": 0.32741162180900574, "logps/chosen": -381.552734375, "logps/rejected": -325.18353271484375, "loss": 0.6424, "rewards/accuracies": 0.6833332777023315, "rewards/chosen": 0.6556231379508972, "rewards/margins": 0.172928124666214, "rewards/rejected": 0.4826950132846832, "step": 240 }, { "epoch": 0.5, "grad_norm": 9.265108108520508, "learning_rate": 3.1375e-05, "logits/chosen": -0.1159602627158165, "logits/rejected": 0.2552518844604492, "logps/chosen": -376.2705078125, "logps/rejected": -324.96026611328125, "loss": 0.6247, "rewards/accuracies": 0.6833333373069763, "rewards/chosen": 0.8996511697769165, "rewards/margins": 0.2674979567527771, "rewards/rejected": 0.6321532726287842, "step": 250 }, { "epoch": 0.5, "eval_logits/chosen": 0.1787189394235611, "eval_logits/rejected": 0.39825698733329773, "eval_logps/chosen": -376.6689758300781, "eval_logps/rejected": -335.21923828125, "eval_loss": 0.6513052582740784, "eval_rewards/accuracies": 0.625, "eval_rewards/chosen": 0.9344526529312134, "eval_rewards/margins": 0.23070192337036133, "eval_rewards/rejected": 0.703750729560852, "eval_runtime": 110.728, "eval_samples_per_second": 2.709, "eval_steps_per_second": 0.343, "step": 250 }, { "epoch": 0.52, "grad_norm": 4.690427303314209, "learning_rate": 3.0125000000000004e-05, "logits/chosen": 0.1452471762895584, "logits/rejected": 0.41113168001174927, "logps/chosen": -405.30914306640625, "logps/rejected": -415.18988037109375, "loss": 0.6646, "rewards/accuracies": 0.6500000357627869, "rewards/chosen": 1.1738603115081787, "rewards/margins": 0.22889454662799835, "rewards/rejected": 0.9449657201766968, "step": 260 }, { "epoch": 0.54, "grad_norm": 4.981466293334961, "learning_rate": 2.8875e-05, "logits/chosen": 0.28828543424606323, "logits/rejected": 0.5267751812934875, "logps/chosen": -389.50616455078125, "logps/rejected": -327.06707763671875, "loss": 0.662, "rewards/accuracies": 0.5833333730697632, "rewards/chosen": 0.9076725244522095, "rewards/margins": 0.21977980434894562, "rewards/rejected": 0.687892735004425, "step": 270 }, { "epoch": 0.56, "grad_norm": 6.570380687713623, "learning_rate": 2.7625e-05, "logits/chosen": 0.11337950080633163, "logits/rejected": 0.17990311980247498, "logps/chosen": -405.74981689453125, "logps/rejected": -312.7770690917969, "loss": 0.5859, "rewards/accuracies": 0.699999988079071, "rewards/chosen": 1.1182396411895752, "rewards/margins": 0.39417314529418945, "rewards/rejected": 0.7240666151046753, "step": 280 }, { "epoch": 0.58, "grad_norm": 6.601053237915039, "learning_rate": 2.6375e-05, "logits/chosen": 0.2042328119277954, "logits/rejected": 0.28559383749961853, "logps/chosen": -372.4433288574219, "logps/rejected": -358.509033203125, "loss": 0.6985, "rewards/accuracies": 0.6000000238418579, "rewards/chosen": 0.9518572688102722, "rewards/margins": 0.1677892506122589, "rewards/rejected": 0.7840681076049805, "step": 290 }, { "epoch": 0.6, "grad_norm": 5.195039749145508, "learning_rate": 2.5124999999999997e-05, "logits/chosen": 0.37824949622154236, "logits/rejected": 0.29513710737228394, "logps/chosen": -385.41351318359375, "logps/rejected": -311.15765380859375, "loss": 0.669, "rewards/accuracies": 0.6333333253860474, "rewards/chosen": 0.6893835067749023, "rewards/margins": 0.19085724651813507, "rewards/rejected": 0.4985261857509613, "step": 300 }, { "epoch": 0.6, "eval_logits/chosen": 0.0961572527885437, "eval_logits/rejected": 0.3124571740627289, "eval_logps/chosen": -379.28277587890625, "eval_logps/rejected": -338.0162048339844, "eval_loss": 0.6259491443634033, "eval_rewards/accuracies": 0.6743420958518982, "eval_rewards/chosen": 0.673072099685669, "eval_rewards/margins": 0.24901530146598816, "eval_rewards/rejected": 0.4240567088127136, "eval_runtime": 110.7031, "eval_samples_per_second": 2.71, "eval_steps_per_second": 0.343, "step": 300 }, { "epoch": 0.62, "grad_norm": 8.175043106079102, "learning_rate": 2.3875e-05, "logits/chosen": 0.23413066565990448, "logits/rejected": 0.22633250057697296, "logps/chosen": -381.376220703125, "logps/rejected": -319.7635803222656, "loss": 0.6727, "rewards/accuracies": 0.5833333730697632, "rewards/chosen": 0.6574802994728088, "rewards/margins": 0.14561817049980164, "rewards/rejected": 0.5118621587753296, "step": 310 }, { "epoch": 0.64, "grad_norm": 11.002555847167969, "learning_rate": 2.2625e-05, "logits/chosen": 0.07112519443035126, "logits/rejected": 0.10473679006099701, "logps/chosen": -312.57354736328125, "logps/rejected": -294.7325134277344, "loss": 0.6895, "rewards/accuracies": 0.6499999761581421, "rewards/chosen": 0.4420788884162903, "rewards/margins": 0.10067237913608551, "rewards/rejected": 0.3414064943790436, "step": 320 }, { "epoch": 0.66, "grad_norm": 5.530636310577393, "learning_rate": 2.1375e-05, "logits/chosen": 0.03359542042016983, "logits/rejected": 0.1980469524860382, "logps/chosen": -368.728271484375, "logps/rejected": -314.3133239746094, "loss": 0.7041, "rewards/accuracies": 0.44999998807907104, "rewards/chosen": 0.4892043173313141, "rewards/margins": 0.07970868051052094, "rewards/rejected": 0.40949565172195435, "step": 330 }, { "epoch": 0.68, "grad_norm": 8.663439750671387, "learning_rate": 2.0125e-05, "logits/chosen": 0.12911926209926605, "logits/rejected": -0.05956228822469711, "logps/chosen": -277.42279052734375, "logps/rejected": -266.2348937988281, "loss": 0.6537, "rewards/accuracies": 0.5833333730697632, "rewards/chosen": 0.4134989380836487, "rewards/margins": 0.160436749458313, "rewards/rejected": 0.2530621886253357, "step": 340 }, { "epoch": 0.7, "grad_norm": 7.686208724975586, "learning_rate": 1.8875e-05, "logits/chosen": 0.07862328737974167, "logits/rejected": 0.07282784581184387, "logps/chosen": -344.50140380859375, "logps/rejected": -294.981689453125, "loss": 0.615, "rewards/accuracies": 0.6166666746139526, "rewards/chosen": 0.46334782242774963, "rewards/margins": 0.27687573432922363, "rewards/rejected": 0.18647213280200958, "step": 350 }, { "epoch": 0.7, "eval_logits/chosen": 0.05921909585595131, "eval_logits/rejected": 0.2736007273197174, "eval_logps/chosen": -380.28326416015625, "eval_logps/rejected": -339.1015625, "eval_loss": 0.6189608573913574, "eval_rewards/accuracies": 0.6809210777282715, "eval_rewards/chosen": 0.573022186756134, "eval_rewards/margins": 0.25749993324279785, "eval_rewards/rejected": 0.3155222237110138, "eval_runtime": 110.7731, "eval_samples_per_second": 2.708, "eval_steps_per_second": 0.343, "step": 350 }, { "epoch": 0.72, "grad_norm": 5.948915004730225, "learning_rate": 1.7625e-05, "logits/chosen": 0.004181022755801678, "logits/rejected": 0.17382146418094635, "logps/chosen": -407.7164611816406, "logps/rejected": -324.44140625, "loss": 0.6017, "rewards/accuracies": 0.6333333253860474, "rewards/chosen": 0.6991059184074402, "rewards/margins": 0.36650750041007996, "rewards/rejected": 0.332598477602005, "step": 360 }, { "epoch": 0.74, "grad_norm": 8.058575630187988, "learning_rate": 1.6375e-05, "logits/chosen": 0.23957493901252747, "logits/rejected": 0.08459005504846573, "logps/chosen": -388.26007080078125, "logps/rejected": -317.60614013671875, "loss": 0.6179, "rewards/accuracies": 0.6000000238418579, "rewards/chosen": 0.7810655236244202, "rewards/margins": 0.2609333395957947, "rewards/rejected": 0.5201321840286255, "step": 370 }, { "epoch": 0.76, "grad_norm": 7.975735187530518, "learning_rate": 1.5125e-05, "logits/chosen": 0.39950278401374817, "logits/rejected": 0.47223711013793945, "logps/chosen": -395.3121032714844, "logps/rejected": -350.27203369140625, "loss": 0.6522, "rewards/accuracies": 0.6500000357627869, "rewards/chosen": 0.5671259164810181, "rewards/margins": 0.16634422540664673, "rewards/rejected": 0.40078169107437134, "step": 380 }, { "epoch": 0.78, "grad_norm": 5.167679309844971, "learning_rate": 1.3875000000000002e-05, "logits/chosen": 0.010129046626389027, "logits/rejected": 0.2368415892124176, "logps/chosen": -382.8428039550781, "logps/rejected": -314.33636474609375, "loss": 0.5346, "rewards/accuracies": 0.7666667103767395, "rewards/chosen": 0.7397487759590149, "rewards/margins": 0.4875487685203552, "rewards/rejected": 0.2521999478340149, "step": 390 }, { "epoch": 0.8, "grad_norm": 5.4159698486328125, "learning_rate": 1.2625e-05, "logits/chosen": 0.26140496134757996, "logits/rejected": 0.40830284357070923, "logps/chosen": -345.0839538574219, "logps/rejected": -333.39727783203125, "loss": 0.7407, "rewards/accuracies": 0.5666666626930237, "rewards/chosen": 0.540732741355896, "rewards/margins": 0.11584854125976562, "rewards/rejected": 0.42488422989845276, "step": 400 }, { "epoch": 0.8, "eval_logits/chosen": 0.11569666862487793, "eval_logits/rejected": 0.3240755498409271, "eval_logps/chosen": -378.1927490234375, "eval_logps/rejected": -337.3643493652344, "eval_loss": 0.6259213089942932, "eval_rewards/accuracies": 0.6710526347160339, "eval_rewards/chosen": 0.7820738554000854, "eval_rewards/margins": 0.29283180832862854, "eval_rewards/rejected": 0.4892421066761017, "eval_runtime": 110.7795, "eval_samples_per_second": 2.708, "eval_steps_per_second": 0.343, "step": 400 }, { "epoch": 0.82, "grad_norm": 3.0558745861053467, "learning_rate": 1.1375e-05, "logits/chosen": 0.052801378071308136, "logits/rejected": 0.28615111112594604, "logps/chosen": -305.16424560546875, "logps/rejected": -311.2315368652344, "loss": 0.7429, "rewards/accuracies": 0.5666666626930237, "rewards/chosen": 0.4710526466369629, "rewards/margins": 0.03450847044587135, "rewards/rejected": 0.43654412031173706, "step": 410 }, { "epoch": 0.84, "grad_norm": 7.435867786407471, "learning_rate": 1.0125e-05, "logits/chosen": 0.041792333126068115, "logits/rejected": 0.17477649450302124, "logps/chosen": -421.61370849609375, "logps/rejected": -367.0201110839844, "loss": 0.6739, "rewards/accuracies": 0.6166666746139526, "rewards/chosen": 0.728044331073761, "rewards/margins": 0.22441256046295166, "rewards/rejected": 0.5036317706108093, "step": 420 }, { "epoch": 0.86, "grad_norm": 6.1076765060424805, "learning_rate": 8.875e-06, "logits/chosen": 0.2842518091201782, "logits/rejected": 0.39951667189598083, "logps/chosen": -426.9200744628906, "logps/rejected": -346.2352600097656, "loss": 0.6611, "rewards/accuracies": 0.5833333730697632, "rewards/chosen": 0.647419810295105, "rewards/margins": 0.18299394845962524, "rewards/rejected": 0.46442586183547974, "step": 430 }, { "epoch": 0.88, "grad_norm": 6.9140119552612305, "learning_rate": 7.625e-06, "logits/chosen": 0.1984386146068573, "logits/rejected": 0.19356411695480347, "logps/chosen": -400.2377624511719, "logps/rejected": -339.1898498535156, "loss": 0.6277, "rewards/accuracies": 0.6500000357627869, "rewards/chosen": 0.6189283728599548, "rewards/margins": 0.2557988464832306, "rewards/rejected": 0.36312955617904663, "step": 440 }, { "epoch": 0.9, "grad_norm": 4.161813735961914, "learning_rate": 6.375000000000001e-06, "logits/chosen": -0.20740225911140442, "logits/rejected": -0.04994301125407219, "logps/chosen": -338.45245361328125, "logps/rejected": -317.4515075683594, "loss": 0.6085, "rewards/accuracies": 0.6166667342185974, "rewards/chosen": 0.6934888362884521, "rewards/margins": 0.31230005621910095, "rewards/rejected": 0.3811888098716736, "step": 450 }, { "epoch": 0.9, "eval_logits/chosen": 0.101429283618927, "eval_logits/rejected": 0.31124716997146606, "eval_logps/chosen": -378.19146728515625, "eval_logps/rejected": -337.322998046875, "eval_loss": 0.6227030158042908, "eval_rewards/accuracies": 0.6776315569877625, "eval_rewards/chosen": 0.7822019457817078, "eval_rewards/margins": 0.28882354497909546, "eval_rewards/rejected": 0.4933784008026123, "eval_runtime": 110.747, "eval_samples_per_second": 2.709, "eval_steps_per_second": 0.343, "step": 450 }, { "epoch": 0.92, "grad_norm": 9.481136322021484, "learning_rate": 5.125e-06, "logits/chosen": 0.22967512905597687, "logits/rejected": 0.469778835773468, "logps/chosen": -368.9932556152344, "logps/rejected": -301.64935302734375, "loss": 0.6316, "rewards/accuracies": 0.7166666984558105, "rewards/chosen": 0.6519312858581543, "rewards/margins": 0.2591342329978943, "rewards/rejected": 0.39279705286026, "step": 460 }, { "epoch": 0.94, "grad_norm": 5.284605979919434, "learning_rate": 3.875e-06, "logits/chosen": -0.15741905570030212, "logits/rejected": -0.07267796993255615, "logps/chosen": -413.9580078125, "logps/rejected": -352.0941467285156, "loss": 0.6124, "rewards/accuracies": 0.6499999761581421, "rewards/chosen": 0.9669933319091797, "rewards/margins": 0.3869830369949341, "rewards/rejected": 0.5800102949142456, "step": 470 }, { "epoch": 0.96, "grad_norm": 6.971217632293701, "learning_rate": 2.625e-06, "logits/chosen": 0.2067793607711792, "logits/rejected": 0.10978493839502335, "logps/chosen": -378.26171875, "logps/rejected": -322.6770324707031, "loss": 0.6398, "rewards/accuracies": 0.6000000238418579, "rewards/chosen": 0.8436048626899719, "rewards/margins": 0.2645290493965149, "rewards/rejected": 0.5790757536888123, "step": 480 }, { "epoch": 0.98, "grad_norm": 4.2455949783325195, "learning_rate": 1.3750000000000002e-06, "logits/chosen": 0.355533629655838, "logits/rejected": 0.5946205258369446, "logps/chosen": -393.5543518066406, "logps/rejected": -336.9477844238281, "loss": 0.642, "rewards/accuracies": 0.6166666746139526, "rewards/chosen": 0.7117866277694702, "rewards/margins": 0.19295310974121094, "rewards/rejected": 0.5188335180282593, "step": 490 }, { "epoch": 1.0, "grad_norm": 6.31891393661499, "learning_rate": 1.2500000000000002e-07, "logits/chosen": 0.09795437753200531, "logits/rejected": 0.1788286566734314, "logps/chosen": -352.4245910644531, "logps/rejected": -358.0443115234375, "loss": 0.7074, "rewards/accuracies": 0.533333420753479, "rewards/chosen": 0.7603829503059387, "rewards/margins": 0.06259284913539886, "rewards/rejected": 0.6977900266647339, "step": 500 }, { "epoch": 1.0, "eval_logits/chosen": 0.10699369758367538, "eval_logits/rejected": 0.31676366925239563, "eval_logps/chosen": -377.9751892089844, "eval_logps/rejected": -337.1114196777344, "eval_loss": 0.623928427696228, "eval_rewards/accuracies": 0.6710526347160339, "eval_rewards/chosen": 0.8038315176963806, "eval_rewards/margins": 0.2892968952655792, "eval_rewards/rejected": 0.5145345330238342, "eval_runtime": 110.7474, "eval_samples_per_second": 2.709, "eval_steps_per_second": 0.343, "step": 500 } ], "logging_steps": 10, "max_steps": 500, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 6, "trial_name": null, "trial_params": null }