{ "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 358, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002793296089385475, "grad_norm": 256.6026611328125, "learning_rate": 1.994413407821229e-06, "logits/chosen": -0.345703125, "logits/rejected": -0.31640625, "logps/chosen": -77.5, "logps/rejected": -97.5, "loss": 22.125, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1 }, { "epoch": 0.00558659217877095, "grad_norm": 295.4891357421875, "learning_rate": 1.988826815642458e-06, "logits/chosen": -0.296875, "logits/rejected": -0.376953125, "logps/chosen": -92.5, "logps/rejected": -88.5, "loss": 21.9844, "rewards/accuracies": 0.4375, "rewards/chosen": 0.0031280517578125, "rewards/margins": 0.0140380859375, "rewards/rejected": -0.01092529296875, "step": 2 }, { "epoch": 0.008379888268156424, "grad_norm": 285.1802062988281, "learning_rate": 1.9832402234636873e-06, "logits/chosen": -0.27734375, "logits/rejected": -0.2890625, "logps/chosen": -93.5, "logps/rejected": -84.5, "loss": 21.8438, "rewards/accuracies": 0.5625, "rewards/chosen": 0.0015716552734375, "rewards/margins": 0.0211181640625, "rewards/rejected": -0.01953125, "step": 3 }, { "epoch": 0.0111731843575419, "grad_norm": 283.6276550292969, "learning_rate": 1.9776536312849162e-06, "logits/chosen": -0.37109375, "logits/rejected": -0.369140625, "logps/chosen": -93.0, "logps/rejected": -91.5, "loss": 22.3438, "rewards/accuracies": 0.4375, "rewards/chosen": -0.01483154296875, "rewards/margins": -0.005462646484375, "rewards/rejected": -0.0093994140625, "step": 4 }, { "epoch": 0.013966480446927373, "grad_norm": 329.6934509277344, "learning_rate": 1.972067039106145e-06, "logits/chosen": -0.435546875, "logits/rejected": -0.44140625, "logps/chosen": -116.5, "logps/rejected": -99.0, "loss": 22.0, "rewards/accuracies": 0.53125, "rewards/chosen": -0.00860595703125, "rewards/margins": 0.0078125, "rewards/rejected": -0.0164794921875, "step": 5 }, { "epoch": 0.01675977653631285, "grad_norm": 299.1175537109375, "learning_rate": 1.966480446927374e-06, "logits/chosen": -0.3203125, "logits/rejected": -0.337890625, "logps/chosen": -82.0, "logps/rejected": -100.5, "loss": 22.1211, "rewards/accuracies": 0.375, "rewards/chosen": -0.015625, "rewards/margins": 0.0023193359375, "rewards/rejected": -0.0179443359375, "step": 6 }, { "epoch": 0.019553072625698324, "grad_norm": 315.2814636230469, "learning_rate": 1.960893854748603e-06, "logits/chosen": -0.392578125, "logits/rejected": -0.359375, "logps/chosen": -102.0, "logps/rejected": -88.5, "loss": 21.9805, "rewards/accuracies": 0.4375, "rewards/chosen": -0.0133056640625, "rewards/margins": 0.0133056640625, "rewards/rejected": -0.026611328125, "step": 7 }, { "epoch": 0.0223463687150838, "grad_norm": 286.9543762207031, "learning_rate": 1.9553072625698325e-06, "logits/chosen": -0.33984375, "logits/rejected": -0.341796875, "logps/chosen": -104.0, "logps/rejected": -97.5, "loss": 22.1719, "rewards/accuracies": 0.5625, "rewards/chosen": -0.0234375, "rewards/margins": 0.0015716552734375, "rewards/rejected": -0.0250244140625, "step": 8 }, { "epoch": 0.025139664804469275, "grad_norm": 269.3601989746094, "learning_rate": 1.9497206703910615e-06, "logits/chosen": -0.30859375, "logits/rejected": -0.34765625, "logps/chosen": -86.0, "logps/rejected": -94.0, "loss": 21.8086, "rewards/accuracies": 0.5, "rewards/chosen": -0.00390625, "rewards/margins": 0.0250244140625, "rewards/rejected": -0.0289306640625, "step": 9 }, { "epoch": 0.027932960893854747, "grad_norm": 291.1910400390625, "learning_rate": 1.9441340782122905e-06, "logits/chosen": -0.36328125, "logits/rejected": -0.34765625, "logps/chosen": -82.0, "logps/rejected": -91.0, "loss": 21.8164, "rewards/accuracies": 0.40625, "rewards/chosen": 0.01171875, "rewards/margins": 0.0234375, "rewards/rejected": -0.01171875, "step": 10 }, { "epoch": 0.030726256983240222, "grad_norm": 328.0159606933594, "learning_rate": 1.9385474860335195e-06, "logits/chosen": -0.357421875, "logits/rejected": -0.36328125, "logps/chosen": -79.5, "logps/rejected": -109.5, "loss": 21.1836, "rewards/accuracies": 0.6875, "rewards/chosen": 0.005462646484375, "rewards/margins": 0.0703125, "rewards/rejected": -0.06494140625, "step": 11 }, { "epoch": 0.0335195530726257, "grad_norm": 269.1614990234375, "learning_rate": 1.9329608938547484e-06, "logits/chosen": -0.353515625, "logits/rejected": -0.376953125, "logps/chosen": -89.5, "logps/rejected": -98.0, "loss": 21.3398, "rewards/accuracies": 0.625, "rewards/chosen": 0.0015716552734375, "rewards/margins": 0.056396484375, "rewards/rejected": -0.0546875, "step": 12 }, { "epoch": 0.036312849162011177, "grad_norm": 288.3379211425781, "learning_rate": 1.9273743016759774e-06, "logits/chosen": -0.349609375, "logits/rejected": -0.283203125, "logps/chosen": -107.0, "logps/rejected": -108.0, "loss": 21.9766, "rewards/accuracies": 0.4375, "rewards/chosen": -0.0390625, "rewards/margins": 0.01953125, "rewards/rejected": -0.05859375, "step": 13 }, { "epoch": 0.03910614525139665, "grad_norm": 279.92376708984375, "learning_rate": 1.9217877094972064e-06, "logits/chosen": -0.328125, "logits/rejected": -0.296875, "logps/chosen": -91.5, "logps/rejected": -104.0, "loss": 22.1367, "rewards/accuracies": 0.5, "rewards/chosen": -0.047607421875, "rewards/margins": 0.0164794921875, "rewards/rejected": -0.06396484375, "step": 14 }, { "epoch": 0.04189944134078212, "grad_norm": 276.461181640625, "learning_rate": 1.9162011173184358e-06, "logits/chosen": -0.322265625, "logits/rejected": -0.359375, "logps/chosen": -100.5, "logps/rejected": -85.5, "loss": 21.6055, "rewards/accuracies": 0.53125, "rewards/chosen": -0.0242919921875, "rewards/margins": 0.044677734375, "rewards/rejected": -0.06884765625, "step": 15 }, { "epoch": 0.0446927374301676, "grad_norm": 273.61114501953125, "learning_rate": 1.9106145251396648e-06, "logits/chosen": -0.3671875, "logits/rejected": -0.369140625, "logps/chosen": -108.0, "logps/rejected": -101.0, "loss": 21.373, "rewards/accuracies": 0.625, "rewards/chosen": -0.02734375, "rewards/margins": 0.0517578125, "rewards/rejected": -0.0791015625, "step": 16 }, { "epoch": 0.04748603351955307, "grad_norm": 290.0361633300781, "learning_rate": 1.9050279329608937e-06, "logits/chosen": -0.33203125, "logits/rejected": -0.318359375, "logps/chosen": -91.0, "logps/rejected": -97.0, "loss": 22.0156, "rewards/accuracies": 0.53125, "rewards/chosen": -0.03125, "rewards/margins": 0.016357421875, "rewards/rejected": -0.0478515625, "step": 17 }, { "epoch": 0.05027932960893855, "grad_norm": 280.7245788574219, "learning_rate": 1.899441340782123e-06, "logits/chosen": -0.34375, "logits/rejected": -0.404296875, "logps/chosen": -93.5, "logps/rejected": -89.5, "loss": 21.1367, "rewards/accuracies": 0.5625, "rewards/chosen": -0.032958984375, "rewards/margins": 0.07275390625, "rewards/rejected": -0.10546875, "step": 18 }, { "epoch": 0.05307262569832402, "grad_norm": 284.1665344238281, "learning_rate": 1.8938547486033519e-06, "logits/chosen": -0.423828125, "logits/rejected": -0.419921875, "logps/chosen": -95.5, "logps/rejected": -89.5, "loss": 20.3066, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0281982421875, "rewards/margins": 0.12890625, "rewards/rejected": -0.1572265625, "step": 19 }, { "epoch": 0.055865921787709494, "grad_norm": 248.25938415527344, "learning_rate": 1.8882681564245809e-06, "logits/chosen": -0.39453125, "logits/rejected": -0.384765625, "logps/chosen": -81.5, "logps/rejected": -83.0, "loss": 20.668, "rewards/accuracies": 0.65625, "rewards/chosen": -0.0230712890625, "rewards/margins": 0.10107421875, "rewards/rejected": -0.12451171875, "step": 20 }, { "epoch": 0.05865921787709497, "grad_norm": 268.36865234375, "learning_rate": 1.88268156424581e-06, "logits/chosen": -0.359375, "logits/rejected": -0.36328125, "logps/chosen": -85.0, "logps/rejected": -91.0, "loss": 21.0566, "rewards/accuracies": 0.65625, "rewards/chosen": -0.029296875, "rewards/margins": 0.080078125, "rewards/rejected": -0.109375, "step": 21 }, { "epoch": 0.061452513966480445, "grad_norm": 313.709716796875, "learning_rate": 1.877094972067039e-06, "logits/chosen": -0.322265625, "logits/rejected": -0.33203125, "logps/chosen": -113.0, "logps/rejected": -110.0, "loss": 21.5039, "rewards/accuracies": 0.59375, "rewards/chosen": -0.06982421875, "rewards/margins": 0.05859375, "rewards/rejected": -0.1279296875, "step": 22 }, { "epoch": 0.06424581005586592, "grad_norm": 289.4493103027344, "learning_rate": 1.871508379888268e-06, "logits/chosen": -0.35546875, "logits/rejected": -0.345703125, "logps/chosen": -94.0, "logps/rejected": -82.0, "loss": 21.5664, "rewards/accuracies": 0.5, "rewards/chosen": -0.06494140625, "rewards/margins": 0.048583984375, "rewards/rejected": -0.11328125, "step": 23 }, { "epoch": 0.0670391061452514, "grad_norm": 260.25811767578125, "learning_rate": 1.865921787709497e-06, "logits/chosen": -0.330078125, "logits/rejected": -0.369140625, "logps/chosen": -76.0, "logps/rejected": -104.0, "loss": 21.4336, "rewards/accuracies": 0.53125, "rewards/chosen": -0.050048828125, "rewards/margins": 0.0634765625, "rewards/rejected": -0.11328125, "step": 24 }, { "epoch": 0.06983240223463687, "grad_norm": 259.52001953125, "learning_rate": 1.8603351955307264e-06, "logits/chosen": -0.392578125, "logits/rejected": -0.365234375, "logps/chosen": -82.0, "logps/rejected": -83.5, "loss": 22.1875, "rewards/accuracies": 0.5, "rewards/chosen": -0.08447265625, "rewards/margins": 0.0172119140625, "rewards/rejected": -0.1015625, "step": 25 }, { "epoch": 0.07262569832402235, "grad_norm": 255.92848205566406, "learning_rate": 1.8547486033519553e-06, "logits/chosen": -0.3828125, "logits/rejected": -0.392578125, "logps/chosen": -79.5, "logps/rejected": -86.0, "loss": 21.4004, "rewards/accuracies": 0.5625, "rewards/chosen": -0.10009765625, "rewards/margins": 0.06494140625, "rewards/rejected": -0.1650390625, "step": 26 }, { "epoch": 0.07541899441340782, "grad_norm": 265.7373962402344, "learning_rate": 1.8491620111731843e-06, "logits/chosen": -0.3671875, "logits/rejected": -0.384765625, "logps/chosen": -95.5, "logps/rejected": -91.5, "loss": 20.7715, "rewards/accuracies": 0.5625, "rewards/chosen": -0.07275390625, "rewards/margins": 0.10546875, "rewards/rejected": -0.1787109375, "step": 27 }, { "epoch": 0.0782122905027933, "grad_norm": 243.359375, "learning_rate": 1.8435754189944133e-06, "logits/chosen": -0.326171875, "logits/rejected": -0.34375, "logps/chosen": -84.0, "logps/rejected": -87.5, "loss": 19.9336, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0078125, "rewards/margins": 0.1669921875, "rewards/rejected": -0.1748046875, "step": 28 }, { "epoch": 0.08100558659217877, "grad_norm": 297.57025146484375, "learning_rate": 1.8379888268156423e-06, "logits/chosen": -0.37890625, "logits/rejected": -0.337890625, "logps/chosen": -120.0, "logps/rejected": -101.5, "loss": 20.6191, "rewards/accuracies": 0.65625, "rewards/chosen": -0.10498046875, "rewards/margins": 0.1220703125, "rewards/rejected": -0.2265625, "step": 29 }, { "epoch": 0.08379888268156424, "grad_norm": 270.07659912109375, "learning_rate": 1.8324022346368714e-06, "logits/chosen": -0.349609375, "logits/rejected": -0.357421875, "logps/chosen": -88.5, "logps/rejected": -100.5, "loss": 20.9258, "rewards/accuracies": 0.59375, "rewards/chosen": -0.0830078125, "rewards/margins": 0.09716796875, "rewards/rejected": -0.1796875, "step": 30 }, { "epoch": 0.08659217877094973, "grad_norm": 250.0308074951172, "learning_rate": 1.8268156424581004e-06, "logits/chosen": -0.306640625, "logits/rejected": -0.34765625, "logps/chosen": -79.0, "logps/rejected": -85.0, "loss": 20.4629, "rewards/accuracies": 0.78125, "rewards/chosen": -0.06298828125, "rewards/margins": 0.1357421875, "rewards/rejected": -0.1982421875, "step": 31 }, { "epoch": 0.0893854748603352, "grad_norm": 292.2855529785156, "learning_rate": 1.8212290502793294e-06, "logits/chosen": -0.361328125, "logits/rejected": -0.39453125, "logps/chosen": -89.5, "logps/rejected": -93.0, "loss": 19.2598, "rewards/accuracies": 0.6875, "rewards/chosen": -0.05712890625, "rewards/margins": 0.224609375, "rewards/rejected": -0.28125, "step": 32 }, { "epoch": 0.09217877094972067, "grad_norm": 321.53924560546875, "learning_rate": 1.8156424581005586e-06, "logits/chosen": -0.38671875, "logits/rejected": -0.341796875, "logps/chosen": -94.5, "logps/rejected": -112.5, "loss": 20.7129, "rewards/accuracies": 0.625, "rewards/chosen": -0.1484375, "rewards/margins": 0.1142578125, "rewards/rejected": -0.26171875, "step": 33 }, { "epoch": 0.09497206703910614, "grad_norm": 308.1737060546875, "learning_rate": 1.8100558659217878e-06, "logits/chosen": -0.28515625, "logits/rejected": -0.375, "logps/chosen": -105.5, "logps/rejected": -98.5, "loss": 21.0957, "rewards/accuracies": 0.625, "rewards/chosen": -0.0966796875, "rewards/margins": 0.1044921875, "rewards/rejected": -0.201171875, "step": 34 }, { "epoch": 0.09776536312849161, "grad_norm": 326.31103515625, "learning_rate": 1.8044692737430167e-06, "logits/chosen": -0.328125, "logits/rejected": -0.31640625, "logps/chosen": -101.0, "logps/rejected": -98.5, "loss": 20.584, "rewards/accuracies": 0.5625, "rewards/chosen": -0.11328125, "rewards/margins": 0.126953125, "rewards/rejected": -0.2412109375, "step": 35 }, { "epoch": 0.1005586592178771, "grad_norm": 279.51611328125, "learning_rate": 1.7988826815642457e-06, "logits/chosen": -0.388671875, "logits/rejected": -0.416015625, "logps/chosen": -95.0, "logps/rejected": -105.0, "loss": 19.7148, "rewards/accuracies": 0.625, "rewards/chosen": -0.0947265625, "rewards/margins": 0.2041015625, "rewards/rejected": -0.298828125, "step": 36 }, { "epoch": 0.10335195530726257, "grad_norm": 244.81387329101562, "learning_rate": 1.7932960893854747e-06, "logits/chosen": -0.353515625, "logits/rejected": -0.380859375, "logps/chosen": -92.5, "logps/rejected": -93.0, "loss": 20.8086, "rewards/accuracies": 0.53125, "rewards/chosen": -0.150390625, "rewards/margins": 0.13671875, "rewards/rejected": -0.287109375, "step": 37 }, { "epoch": 0.10614525139664804, "grad_norm": 259.0108947753906, "learning_rate": 1.7877094972067037e-06, "logits/chosen": -0.328125, "logits/rejected": -0.314453125, "logps/chosen": -87.5, "logps/rejected": -101.5, "loss": 18.6191, "rewards/accuracies": 0.75, "rewards/chosen": -0.09228515625, "rewards/margins": 0.275390625, "rewards/rejected": -0.3671875, "step": 38 }, { "epoch": 0.10893854748603352, "grad_norm": 274.03594970703125, "learning_rate": 1.7821229050279328e-06, "logits/chosen": -0.38671875, "logits/rejected": -0.412109375, "logps/chosen": -91.5, "logps/rejected": -117.5, "loss": 19.5586, "rewards/accuracies": 0.71875, "rewards/chosen": -0.1611328125, "rewards/margins": 0.2177734375, "rewards/rejected": -0.37890625, "step": 39 }, { "epoch": 0.11173184357541899, "grad_norm": 271.23931884765625, "learning_rate": 1.776536312849162e-06, "logits/chosen": -0.298828125, "logits/rejected": -0.294921875, "logps/chosen": -80.5, "logps/rejected": -102.5, "loss": 21.7168, "rewards/accuracies": 0.5, "rewards/chosen": -0.2001953125, "rewards/margins": 0.07666015625, "rewards/rejected": -0.27734375, "step": 40 }, { "epoch": 0.11452513966480447, "grad_norm": 263.5591125488281, "learning_rate": 1.770949720670391e-06, "logits/chosen": -0.33203125, "logits/rejected": -0.36328125, "logps/chosen": -96.0, "logps/rejected": -86.0, "loss": 19.4785, "rewards/accuracies": 0.6875, "rewards/chosen": -0.197265625, "rewards/margins": 0.212890625, "rewards/rejected": -0.41015625, "step": 41 }, { "epoch": 0.11731843575418995, "grad_norm": 263.2105712890625, "learning_rate": 1.76536312849162e-06, "logits/chosen": -0.279296875, "logits/rejected": -0.2890625, "logps/chosen": -82.0, "logps/rejected": -97.5, "loss": 17.5469, "rewards/accuracies": 0.84375, "rewards/chosen": -0.0908203125, "rewards/margins": 0.337890625, "rewards/rejected": -0.427734375, "step": 42 }, { "epoch": 0.12011173184357542, "grad_norm": 281.099609375, "learning_rate": 1.7597765363128492e-06, "logits/chosen": -0.310546875, "logits/rejected": -0.306640625, "logps/chosen": -93.5, "logps/rejected": -111.0, "loss": 19.3574, "rewards/accuracies": 0.625, "rewards/chosen": -0.09765625, "rewards/margins": 0.2412109375, "rewards/rejected": -0.33984375, "step": 43 }, { "epoch": 0.12290502793296089, "grad_norm": 282.9934387207031, "learning_rate": 1.7541899441340781e-06, "logits/chosen": -0.31640625, "logits/rejected": -0.35546875, "logps/chosen": -98.0, "logps/rejected": -97.5, "loss": 20.2656, "rewards/accuracies": 0.625, "rewards/chosen": -0.18359375, "rewards/margins": 0.189453125, "rewards/rejected": -0.373046875, "step": 44 }, { "epoch": 0.12569832402234637, "grad_norm": 356.30303955078125, "learning_rate": 1.7486033519553071e-06, "logits/chosen": -0.3515625, "logits/rejected": -0.33984375, "logps/chosen": -110.5, "logps/rejected": -97.0, "loss": 22.1113, "rewards/accuracies": 0.53125, "rewards/chosen": -0.302734375, "rewards/margins": 0.052490234375, "rewards/rejected": -0.35546875, "step": 45 }, { "epoch": 0.12849162011173185, "grad_norm": 276.78375244140625, "learning_rate": 1.743016759776536e-06, "logits/chosen": -0.34375, "logits/rejected": -0.345703125, "logps/chosen": -94.0, "logps/rejected": -111.5, "loss": 20.3848, "rewards/accuracies": 0.53125, "rewards/chosen": -0.236328125, "rewards/margins": 0.1904296875, "rewards/rejected": -0.427734375, "step": 46 }, { "epoch": 0.13128491620111732, "grad_norm": 290.17236328125, "learning_rate": 1.7374301675977655e-06, "logits/chosen": -0.33984375, "logits/rejected": -0.3515625, "logps/chosen": -103.5, "logps/rejected": -90.5, "loss": 20.7354, "rewards/accuracies": 0.625, "rewards/chosen": -0.2060546875, "rewards/margins": 0.1259765625, "rewards/rejected": -0.33203125, "step": 47 }, { "epoch": 0.1340782122905028, "grad_norm": 254.7382354736328, "learning_rate": 1.7318435754189945e-06, "logits/chosen": -0.322265625, "logits/rejected": -0.345703125, "logps/chosen": -83.5, "logps/rejected": -99.0, "loss": 18.3164, "rewards/accuracies": 0.78125, "rewards/chosen": -0.10546875, "rewards/margins": 0.294921875, "rewards/rejected": -0.400390625, "step": 48 }, { "epoch": 0.13687150837988826, "grad_norm": 269.2069396972656, "learning_rate": 1.7262569832402234e-06, "logits/chosen": -0.337890625, "logits/rejected": -0.337890625, "logps/chosen": -84.5, "logps/rejected": -87.0, "loss": 21.4395, "rewards/accuracies": 0.5625, "rewards/chosen": -0.2294921875, "rewards/margins": 0.07861328125, "rewards/rejected": -0.30859375, "step": 49 }, { "epoch": 0.13966480446927373, "grad_norm": 275.1954040527344, "learning_rate": 1.7206703910614524e-06, "logits/chosen": -0.3515625, "logits/rejected": -0.34375, "logps/chosen": -92.0, "logps/rejected": -101.5, "loss": 19.7168, "rewards/accuracies": 0.75, "rewards/chosen": -0.1884765625, "rewards/margins": 0.24609375, "rewards/rejected": -0.435546875, "step": 50 }, { "epoch": 0.1424581005586592, "grad_norm": 277.624755859375, "learning_rate": 1.7150837988826814e-06, "logits/chosen": -0.33203125, "logits/rejected": -0.333984375, "logps/chosen": -83.0, "logps/rejected": -116.5, "loss": 17.4199, "rewards/accuracies": 0.71875, "rewards/chosen": -0.26171875, "rewards/margins": 0.3984375, "rewards/rejected": -0.66015625, "step": 51 }, { "epoch": 0.1452513966480447, "grad_norm": 323.80096435546875, "learning_rate": 1.7094972067039106e-06, "logits/chosen": -0.375, "logits/rejected": -0.404296875, "logps/chosen": -96.5, "logps/rejected": -79.5, "loss": 21.252, "rewards/accuracies": 0.625, "rewards/chosen": -0.267578125, "rewards/margins": 0.10595703125, "rewards/rejected": -0.373046875, "step": 52 }, { "epoch": 0.14804469273743018, "grad_norm": 273.6333312988281, "learning_rate": 1.7039106145251395e-06, "logits/chosen": -0.357421875, "logits/rejected": -0.33203125, "logps/chosen": -85.5, "logps/rejected": -106.5, "loss": 18.3594, "rewards/accuracies": 0.6875, "rewards/chosen": -0.279296875, "rewards/margins": 0.330078125, "rewards/rejected": -0.609375, "step": 53 }, { "epoch": 0.15083798882681565, "grad_norm": 353.44879150390625, "learning_rate": 1.6983240223463687e-06, "logits/chosen": -0.314453125, "logits/rejected": -0.318359375, "logps/chosen": -120.0, "logps/rejected": -124.0, "loss": 20.916, "rewards/accuracies": 0.5625, "rewards/chosen": -0.38671875, "rewards/margins": 0.169921875, "rewards/rejected": -0.5546875, "step": 54 }, { "epoch": 0.15363128491620112, "grad_norm": 259.3537292480469, "learning_rate": 1.6927374301675977e-06, "logits/chosen": -0.326171875, "logits/rejected": -0.32421875, "logps/chosen": -89.5, "logps/rejected": -96.5, "loss": 19.1431, "rewards/accuracies": 0.65625, "rewards/chosen": -0.2294921875, "rewards/margins": 0.28125, "rewards/rejected": -0.51171875, "step": 55 }, { "epoch": 0.1564245810055866, "grad_norm": 282.6184997558594, "learning_rate": 1.6871508379888269e-06, "logits/chosen": -0.310546875, "logits/rejected": -0.34375, "logps/chosen": -95.0, "logps/rejected": -121.5, "loss": 17.5469, "rewards/accuracies": 0.71875, "rewards/chosen": -0.2578125, "rewards/margins": 0.38671875, "rewards/rejected": -0.64453125, "step": 56 }, { "epoch": 0.15921787709497207, "grad_norm": 366.9585876464844, "learning_rate": 1.6815642458100559e-06, "logits/chosen": -0.375, "logits/rejected": -0.3359375, "logps/chosen": -130.0, "logps/rejected": -112.5, "loss": 20.042, "rewards/accuracies": 0.59375, "rewards/chosen": -0.421875, "rewards/margins": 0.2373046875, "rewards/rejected": -0.66015625, "step": 57 }, { "epoch": 0.16201117318435754, "grad_norm": 301.4384765625, "learning_rate": 1.6759776536312848e-06, "logits/chosen": -0.33984375, "logits/rejected": -0.322265625, "logps/chosen": -80.0, "logps/rejected": -129.0, "loss": 18.6396, "rewards/accuracies": 0.625, "rewards/chosen": -0.3125, "rewards/margins": 0.35546875, "rewards/rejected": -0.66796875, "step": 58 }, { "epoch": 0.164804469273743, "grad_norm": 265.765869140625, "learning_rate": 1.6703910614525138e-06, "logits/chosen": -0.37890625, "logits/rejected": -0.380859375, "logps/chosen": -102.0, "logps/rejected": -106.0, "loss": 17.8291, "rewards/accuracies": 0.71875, "rewards/chosen": -0.3125, "rewards/margins": 0.3984375, "rewards/rejected": -0.7109375, "step": 59 }, { "epoch": 0.16759776536312848, "grad_norm": 327.72857666015625, "learning_rate": 1.6648044692737428e-06, "logits/chosen": -0.3046875, "logits/rejected": -0.302734375, "logps/chosen": -105.0, "logps/rejected": -96.5, "loss": 19.3115, "rewards/accuracies": 0.78125, "rewards/chosen": -0.291015625, "rewards/margins": 0.2578125, "rewards/rejected": -0.546875, "step": 60 }, { "epoch": 0.17039106145251395, "grad_norm": 262.9339599609375, "learning_rate": 1.6592178770949722e-06, "logits/chosen": -0.349609375, "logits/rejected": -0.32421875, "logps/chosen": -101.5, "logps/rejected": -98.0, "loss": 18.5996, "rewards/accuracies": 0.75, "rewards/chosen": -0.291015625, "rewards/margins": 0.29296875, "rewards/rejected": -0.58203125, "step": 61 }, { "epoch": 0.17318435754189945, "grad_norm": 274.6334228515625, "learning_rate": 1.6536312849162011e-06, "logits/chosen": -0.353515625, "logits/rejected": -0.330078125, "logps/chosen": -77.5, "logps/rejected": -100.5, "loss": 18.5791, "rewards/accuracies": 0.71875, "rewards/chosen": -0.259765625, "rewards/margins": 0.330078125, "rewards/rejected": -0.58984375, "step": 62 }, { "epoch": 0.17597765363128492, "grad_norm": 297.5271911621094, "learning_rate": 1.6480446927374301e-06, "logits/chosen": -0.30078125, "logits/rejected": -0.28515625, "logps/chosen": -100.0, "logps/rejected": -89.0, "loss": 20.7773, "rewards/accuracies": 0.5, "rewards/chosen": -0.314453125, "rewards/margins": 0.19921875, "rewards/rejected": -0.51171875, "step": 63 }, { "epoch": 0.1787709497206704, "grad_norm": 312.4275817871094, "learning_rate": 1.642458100558659e-06, "logits/chosen": -0.361328125, "logits/rejected": -0.361328125, "logps/chosen": -105.0, "logps/rejected": -134.0, "loss": 18.4863, "rewards/accuracies": 0.65625, "rewards/chosen": -0.267578125, "rewards/margins": 0.365234375, "rewards/rejected": -0.6328125, "step": 64 }, { "epoch": 0.18156424581005587, "grad_norm": 297.28753662109375, "learning_rate": 1.6368715083798883e-06, "logits/chosen": -0.4296875, "logits/rejected": -0.408203125, "logps/chosen": -95.0, "logps/rejected": -100.5, "loss": 22.3936, "rewards/accuracies": 0.46875, "rewards/chosen": -0.4453125, "rewards/margins": 0.08056640625, "rewards/rejected": -0.52734375, "step": 65 }, { "epoch": 0.18435754189944134, "grad_norm": 281.25787353515625, "learning_rate": 1.6312849162011173e-06, "logits/chosen": -0.375, "logits/rejected": -0.3515625, "logps/chosen": -97.5, "logps/rejected": -100.5, "loss": 17.6816, "rewards/accuracies": 0.6875, "rewards/chosen": -0.330078125, "rewards/margins": 0.380859375, "rewards/rejected": -0.7109375, "step": 66 }, { "epoch": 0.1871508379888268, "grad_norm": 318.2833557128906, "learning_rate": 1.6256983240223462e-06, "logits/chosen": -0.3515625, "logits/rejected": -0.376953125, "logps/chosen": -107.0, "logps/rejected": -93.5, "loss": 19.7139, "rewards/accuracies": 0.65625, "rewards/chosen": -0.333984375, "rewards/margins": 0.2158203125, "rewards/rejected": -0.55078125, "step": 67 }, { "epoch": 0.18994413407821228, "grad_norm": 266.2276916503906, "learning_rate": 1.6201117318435752e-06, "logits/chosen": -0.37109375, "logits/rejected": -0.38671875, "logps/chosen": -78.0, "logps/rejected": -100.5, "loss": 17.2871, "rewards/accuracies": 0.75, "rewards/chosen": -0.2392578125, "rewards/margins": 0.408203125, "rewards/rejected": -0.6484375, "step": 68 }, { "epoch": 0.19273743016759776, "grad_norm": 311.46820068359375, "learning_rate": 1.6145251396648044e-06, "logits/chosen": -0.34375, "logits/rejected": -0.349609375, "logps/chosen": -91.0, "logps/rejected": -97.5, "loss": 19.6729, "rewards/accuracies": 0.5625, "rewards/chosen": -0.36328125, "rewards/margins": 0.236328125, "rewards/rejected": -0.6015625, "step": 69 }, { "epoch": 0.19553072625698323, "grad_norm": 289.0143127441406, "learning_rate": 1.6089385474860336e-06, "logits/chosen": -0.365234375, "logits/rejected": -0.388671875, "logps/chosen": -91.5, "logps/rejected": -116.0, "loss": 17.2031, "rewards/accuracies": 0.78125, "rewards/chosen": -0.373046875, "rewards/margins": 0.466796875, "rewards/rejected": -0.83984375, "step": 70 }, { "epoch": 0.19832402234636873, "grad_norm": 284.05615234375, "learning_rate": 1.6033519553072625e-06, "logits/chosen": -0.3359375, "logits/rejected": -0.34375, "logps/chosen": -92.0, "logps/rejected": -101.0, "loss": 17.666, "rewards/accuracies": 0.71875, "rewards/chosen": -0.31640625, "rewards/margins": 0.37890625, "rewards/rejected": -0.6953125, "step": 71 }, { "epoch": 0.2011173184357542, "grad_norm": 291.7407531738281, "learning_rate": 1.5977653631284915e-06, "logits/chosen": -0.369140625, "logits/rejected": -0.39453125, "logps/chosen": -93.5, "logps/rejected": -102.5, "loss": 18.8462, "rewards/accuracies": 0.65625, "rewards/chosen": -0.357421875, "rewards/margins": 0.3125, "rewards/rejected": -0.66796875, "step": 72 }, { "epoch": 0.20391061452513967, "grad_norm": 263.26300048828125, "learning_rate": 1.5921787709497205e-06, "logits/chosen": -0.3828125, "logits/rejected": -0.384765625, "logps/chosen": -95.5, "logps/rejected": -97.0, "loss": 17.7002, "rewards/accuracies": 0.71875, "rewards/chosen": -0.29296875, "rewards/margins": 0.38671875, "rewards/rejected": -0.6796875, "step": 73 }, { "epoch": 0.20670391061452514, "grad_norm": 294.2403564453125, "learning_rate": 1.5865921787709497e-06, "logits/chosen": -0.353515625, "logits/rejected": -0.337890625, "logps/chosen": -93.5, "logps/rejected": -102.0, "loss": 19.8887, "rewards/accuracies": 0.625, "rewards/chosen": -0.423828125, "rewards/margins": 0.248046875, "rewards/rejected": -0.671875, "step": 74 }, { "epoch": 0.20949720670391062, "grad_norm": 292.4964904785156, "learning_rate": 1.5810055865921786e-06, "logits/chosen": -0.333984375, "logits/rejected": -0.359375, "logps/chosen": -87.5, "logps/rejected": -119.5, "loss": 19.4604, "rewards/accuracies": 0.75, "rewards/chosen": -0.337890625, "rewards/margins": 0.275390625, "rewards/rejected": -0.61328125, "step": 75 }, { "epoch": 0.2122905027932961, "grad_norm": 276.1828918457031, "learning_rate": 1.5754189944134078e-06, "logits/chosen": -0.38671875, "logits/rejected": -0.40625, "logps/chosen": -86.0, "logps/rejected": -113.0, "loss": 17.6909, "rewards/accuracies": 0.78125, "rewards/chosen": -0.267578125, "rewards/margins": 0.439453125, "rewards/rejected": -0.70703125, "step": 76 }, { "epoch": 0.21508379888268156, "grad_norm": 316.1467590332031, "learning_rate": 1.5698324022346368e-06, "logits/chosen": -0.328125, "logits/rejected": -0.333984375, "logps/chosen": -105.0, "logps/rejected": -133.0, "loss": 20.1733, "rewards/accuracies": 0.6875, "rewards/chosen": -0.390625, "rewards/margins": 0.2353515625, "rewards/rejected": -0.625, "step": 77 }, { "epoch": 0.21787709497206703, "grad_norm": 287.6448669433594, "learning_rate": 1.5642458100558658e-06, "logits/chosen": -0.365234375, "logits/rejected": -0.35546875, "logps/chosen": -102.5, "logps/rejected": -108.5, "loss": 17.9492, "rewards/accuracies": 0.75, "rewards/chosen": -0.369140625, "rewards/margins": 0.34375, "rewards/rejected": -0.71484375, "step": 78 }, { "epoch": 0.2206703910614525, "grad_norm": 325.39825439453125, "learning_rate": 1.558659217877095e-06, "logits/chosen": -0.40625, "logits/rejected": -0.38671875, "logps/chosen": -93.5, "logps/rejected": -95.5, "loss": 19.6279, "rewards/accuracies": 0.65625, "rewards/chosen": -0.419921875, "rewards/margins": 0.30859375, "rewards/rejected": -0.73046875, "step": 79 }, { "epoch": 0.22346368715083798, "grad_norm": 332.19598388671875, "learning_rate": 1.553072625698324e-06, "logits/chosen": -0.357421875, "logits/rejected": -0.361328125, "logps/chosen": -91.5, "logps/rejected": -109.5, "loss": 16.2402, "rewards/accuracies": 0.75, "rewards/chosen": -0.265625, "rewards/margins": 0.50390625, "rewards/rejected": -0.76953125, "step": 80 }, { "epoch": 0.22625698324022347, "grad_norm": 300.1006164550781, "learning_rate": 1.547486033519553e-06, "logits/chosen": -0.34375, "logits/rejected": -0.349609375, "logps/chosen": -102.0, "logps/rejected": -98.5, "loss": 19.6621, "rewards/accuracies": 0.625, "rewards/chosen": -0.42578125, "rewards/margins": 0.21484375, "rewards/rejected": -0.640625, "step": 81 }, { "epoch": 0.22905027932960895, "grad_norm": 277.4262390136719, "learning_rate": 1.5418994413407819e-06, "logits/chosen": -0.33203125, "logits/rejected": -0.373046875, "logps/chosen": -96.5, "logps/rejected": -100.0, "loss": 16.3877, "rewards/accuracies": 0.71875, "rewards/chosen": -0.341796875, "rewards/margins": 0.546875, "rewards/rejected": -0.890625, "step": 82 }, { "epoch": 0.23184357541899442, "grad_norm": 294.208740234375, "learning_rate": 1.5363128491620113e-06, "logits/chosen": -0.30859375, "logits/rejected": -0.337890625, "logps/chosen": -95.0, "logps/rejected": -99.5, "loss": 19.5273, "rewards/accuracies": 0.65625, "rewards/chosen": -0.4140625, "rewards/margins": 0.31640625, "rewards/rejected": -0.73046875, "step": 83 }, { "epoch": 0.2346368715083799, "grad_norm": 258.2681579589844, "learning_rate": 1.5307262569832403e-06, "logits/chosen": -0.3984375, "logits/rejected": -0.390625, "logps/chosen": -88.5, "logps/rejected": -106.0, "loss": 17.7412, "rewards/accuracies": 0.6875, "rewards/chosen": -0.33203125, "rewards/margins": 0.443359375, "rewards/rejected": -0.7734375, "step": 84 }, { "epoch": 0.23743016759776536, "grad_norm": 276.0726013183594, "learning_rate": 1.5251396648044692e-06, "logits/chosen": -0.3359375, "logits/rejected": -0.345703125, "logps/chosen": -107.0, "logps/rejected": -101.5, "loss": 17.1997, "rewards/accuracies": 0.71875, "rewards/chosen": -0.408203125, "rewards/margins": 0.5078125, "rewards/rejected": -0.9140625, "step": 85 }, { "epoch": 0.24022346368715083, "grad_norm": 342.5546569824219, "learning_rate": 1.5195530726256982e-06, "logits/chosen": -0.34765625, "logits/rejected": -0.337890625, "logps/chosen": -122.0, "logps/rejected": -146.0, "loss": 16.4707, "rewards/accuracies": 0.78125, "rewards/chosen": -0.443359375, "rewards/margins": 0.62109375, "rewards/rejected": -1.0625, "step": 86 }, { "epoch": 0.2430167597765363, "grad_norm": 277.0479431152344, "learning_rate": 1.5139664804469272e-06, "logits/chosen": -0.373046875, "logits/rejected": -0.376953125, "logps/chosen": -86.0, "logps/rejected": -106.0, "loss": 16.3242, "rewards/accuracies": 0.78125, "rewards/chosen": -0.353515625, "rewards/margins": 0.55859375, "rewards/rejected": -0.9140625, "step": 87 }, { "epoch": 0.24581005586592178, "grad_norm": 290.22113037109375, "learning_rate": 1.5083798882681564e-06, "logits/chosen": -0.34765625, "logits/rejected": -0.34765625, "logps/chosen": -101.0, "logps/rejected": -87.5, "loss": 18.4434, "rewards/accuracies": 0.65625, "rewards/chosen": -0.41796875, "rewards/margins": 0.34375, "rewards/rejected": -0.76171875, "step": 88 }, { "epoch": 0.24860335195530725, "grad_norm": 249.39596557617188, "learning_rate": 1.5027932960893853e-06, "logits/chosen": -0.380859375, "logits/rejected": -0.404296875, "logps/chosen": -86.0, "logps/rejected": -115.5, "loss": 16.0957, "rewards/accuracies": 0.65625, "rewards/chosen": -0.40625, "rewards/margins": 0.59765625, "rewards/rejected": -1.0078125, "step": 89 }, { "epoch": 0.25139664804469275, "grad_norm": 284.4470520019531, "learning_rate": 1.4972067039106145e-06, "logits/chosen": -0.341796875, "logits/rejected": -0.34765625, "logps/chosen": -100.5, "logps/rejected": -97.5, "loss": 18.0605, "rewards/accuracies": 0.78125, "rewards/chosen": -0.5390625, "rewards/margins": 0.376953125, "rewards/rejected": -0.9140625, "step": 90 }, { "epoch": 0.2541899441340782, "grad_norm": 261.2840576171875, "learning_rate": 1.4916201117318435e-06, "logits/chosen": -0.41796875, "logits/rejected": -0.39453125, "logps/chosen": -94.0, "logps/rejected": -95.0, "loss": 19.04, "rewards/accuracies": 0.6875, "rewards/chosen": -0.439453125, "rewards/margins": 0.349609375, "rewards/rejected": -0.7890625, "step": 91 }, { "epoch": 0.2569832402234637, "grad_norm": 290.4960021972656, "learning_rate": 1.4860335195530727e-06, "logits/chosen": -0.36328125, "logits/rejected": -0.375, "logps/chosen": -92.5, "logps/rejected": -96.5, "loss": 21.1797, "rewards/accuracies": 0.5625, "rewards/chosen": -0.41015625, "rewards/margins": 0.095703125, "rewards/rejected": -0.50390625, "step": 92 }, { "epoch": 0.25977653631284914, "grad_norm": 348.5252380371094, "learning_rate": 1.4804469273743017e-06, "logits/chosen": -0.263671875, "logits/rejected": -0.263671875, "logps/chosen": -106.0, "logps/rejected": -121.0, "loss": 17.8857, "rewards/accuracies": 0.71875, "rewards/chosen": -0.38671875, "rewards/margins": 0.48046875, "rewards/rejected": -0.8671875, "step": 93 }, { "epoch": 0.26256983240223464, "grad_norm": 317.4393310546875, "learning_rate": 1.4748603351955306e-06, "logits/chosen": -0.357421875, "logits/rejected": -0.361328125, "logps/chosen": -105.0, "logps/rejected": -111.5, "loss": 18.4482, "rewards/accuracies": 0.625, "rewards/chosen": -0.56640625, "rewards/margins": 0.36328125, "rewards/rejected": -0.9296875, "step": 94 }, { "epoch": 0.26536312849162014, "grad_norm": 268.0623474121094, "learning_rate": 1.4692737430167596e-06, "logits/chosen": -0.328125, "logits/rejected": -0.337890625, "logps/chosen": -97.5, "logps/rejected": -104.0, "loss": 16.9263, "rewards/accuracies": 0.71875, "rewards/chosen": -0.330078125, "rewards/margins": 0.50390625, "rewards/rejected": -0.8359375, "step": 95 }, { "epoch": 0.2681564245810056, "grad_norm": 332.9473571777344, "learning_rate": 1.4636871508379886e-06, "logits/chosen": -0.36328125, "logits/rejected": -0.41796875, "logps/chosen": -112.0, "logps/rejected": -112.0, "loss": 17.8076, "rewards/accuracies": 0.59375, "rewards/chosen": -0.5234375, "rewards/margins": 0.5703125, "rewards/rejected": -1.09375, "step": 96 }, { "epoch": 0.2709497206703911, "grad_norm": 256.96331787109375, "learning_rate": 1.458100558659218e-06, "logits/chosen": -0.41015625, "logits/rejected": -0.41796875, "logps/chosen": -87.5, "logps/rejected": -93.5, "loss": 17.1279, "rewards/accuracies": 0.71875, "rewards/chosen": -0.49609375, "rewards/margins": 0.474609375, "rewards/rejected": -0.96875, "step": 97 }, { "epoch": 0.2737430167597765, "grad_norm": 293.7779541015625, "learning_rate": 1.452513966480447e-06, "logits/chosen": -0.447265625, "logits/rejected": -0.484375, "logps/chosen": -88.5, "logps/rejected": -133.0, "loss": 17.3354, "rewards/accuracies": 0.71875, "rewards/chosen": -0.62109375, "rewards/margins": 0.50390625, "rewards/rejected": -1.125, "step": 98 }, { "epoch": 0.276536312849162, "grad_norm": 284.48944091796875, "learning_rate": 1.446927374301676e-06, "logits/chosen": -0.369140625, "logits/rejected": -0.359375, "logps/chosen": -86.0, "logps/rejected": -105.5, "loss": 16.957, "rewards/accuracies": 0.78125, "rewards/chosen": -0.49609375, "rewards/margins": 0.53125, "rewards/rejected": -1.03125, "step": 99 }, { "epoch": 0.27932960893854747, "grad_norm": 305.5168151855469, "learning_rate": 1.441340782122905e-06, "logits/chosen": -0.3671875, "logits/rejected": -0.375, "logps/chosen": -89.0, "logps/rejected": -101.5, "loss": 20.2715, "rewards/accuracies": 0.5625, "rewards/chosen": -0.55078125, "rewards/margins": 0.240234375, "rewards/rejected": -0.79296875, "step": 100 }, { "epoch": 0.28212290502793297, "grad_norm": 267.3368835449219, "learning_rate": 1.435754189944134e-06, "logits/chosen": -0.38671875, "logits/rejected": -0.38671875, "logps/chosen": -85.0, "logps/rejected": -98.5, "loss": 16.0693, "rewards/accuracies": 0.8125, "rewards/chosen": -0.392578125, "rewards/margins": 0.5078125, "rewards/rejected": -0.8984375, "step": 101 }, { "epoch": 0.2849162011173184, "grad_norm": 294.2137451171875, "learning_rate": 1.430167597765363e-06, "logits/chosen": -0.3828125, "logits/rejected": -0.392578125, "logps/chosen": -99.5, "logps/rejected": -104.5, "loss": 18.8057, "rewards/accuracies": 0.75, "rewards/chosen": -0.50390625, "rewards/margins": 0.373046875, "rewards/rejected": -0.875, "step": 102 }, { "epoch": 0.2877094972067039, "grad_norm": 288.622802734375, "learning_rate": 1.424581005586592e-06, "logits/chosen": -0.41015625, "logits/rejected": -0.34375, "logps/chosen": -89.5, "logps/rejected": -99.5, "loss": 17.2949, "rewards/accuracies": 0.75, "rewards/chosen": -0.62109375, "rewards/margins": 0.486328125, "rewards/rejected": -1.109375, "step": 103 }, { "epoch": 0.2905027932960894, "grad_norm": 316.19549560546875, "learning_rate": 1.4189944134078212e-06, "logits/chosen": -0.365234375, "logits/rejected": -0.33984375, "logps/chosen": -85.5, "logps/rejected": -96.0, "loss": 20.4395, "rewards/accuracies": 0.5, "rewards/chosen": -0.56640625, "rewards/margins": 0.232421875, "rewards/rejected": -0.80078125, "step": 104 }, { "epoch": 0.29329608938547486, "grad_norm": 302.5723876953125, "learning_rate": 1.4134078212290502e-06, "logits/chosen": -0.337890625, "logits/rejected": -0.388671875, "logps/chosen": -92.5, "logps/rejected": -101.5, "loss": 15.5115, "rewards/accuracies": 0.78125, "rewards/chosen": -0.40625, "rewards/margins": 0.71875, "rewards/rejected": -1.125, "step": 105 }, { "epoch": 0.29608938547486036, "grad_norm": 276.82421875, "learning_rate": 1.4078212290502794e-06, "logits/chosen": -0.345703125, "logits/rejected": -0.337890625, "logps/chosen": -88.5, "logps/rejected": -103.0, "loss": 16.2673, "rewards/accuracies": 0.78125, "rewards/chosen": -0.58203125, "rewards/margins": 0.625, "rewards/rejected": -1.203125, "step": 106 }, { "epoch": 0.2988826815642458, "grad_norm": 263.71063232421875, "learning_rate": 1.4022346368715083e-06, "logits/chosen": -0.341796875, "logits/rejected": -0.400390625, "logps/chosen": -89.0, "logps/rejected": -117.0, "loss": 14.8191, "rewards/accuracies": 0.75, "rewards/chosen": -0.404296875, "rewards/margins": 0.73046875, "rewards/rejected": -1.1328125, "step": 107 }, { "epoch": 0.3016759776536313, "grad_norm": 301.1495361328125, "learning_rate": 1.3966480446927373e-06, "logits/chosen": -0.369140625, "logits/rejected": -0.412109375, "logps/chosen": -101.0, "logps/rejected": -133.0, "loss": 17.002, "rewards/accuracies": 0.6875, "rewards/chosen": -0.5390625, "rewards/margins": 0.494140625, "rewards/rejected": -1.03125, "step": 108 }, { "epoch": 0.30446927374301674, "grad_norm": 281.0001525878906, "learning_rate": 1.3910614525139663e-06, "logits/chosen": -0.34375, "logits/rejected": -0.349609375, "logps/chosen": -90.5, "logps/rejected": -92.5, "loss": 16.9565, "rewards/accuracies": 0.78125, "rewards/chosen": -0.482421875, "rewards/margins": 0.484375, "rewards/rejected": -0.96875, "step": 109 }, { "epoch": 0.30726256983240224, "grad_norm": 275.0584411621094, "learning_rate": 1.3854748603351955e-06, "logits/chosen": -0.33203125, "logits/rejected": -0.375, "logps/chosen": -91.0, "logps/rejected": -99.0, "loss": 13.9038, "rewards/accuracies": 0.84375, "rewards/chosen": -0.3125, "rewards/margins": 0.74609375, "rewards/rejected": -1.0546875, "step": 110 }, { "epoch": 0.3100558659217877, "grad_norm": 291.00201416015625, "learning_rate": 1.3798882681564247e-06, "logits/chosen": -0.40234375, "logits/rejected": -0.353515625, "logps/chosen": -101.0, "logps/rejected": -121.0, "loss": 17.5623, "rewards/accuracies": 0.59375, "rewards/chosen": -0.59375, "rewards/margins": 0.62109375, "rewards/rejected": -1.21875, "step": 111 }, { "epoch": 0.3128491620111732, "grad_norm": 285.26812744140625, "learning_rate": 1.3743016759776536e-06, "logits/chosen": -0.337890625, "logits/rejected": -0.328125, "logps/chosen": -93.5, "logps/rejected": -123.0, "loss": 15.1797, "rewards/accuracies": 0.84375, "rewards/chosen": -0.423828125, "rewards/margins": 0.60546875, "rewards/rejected": -1.03125, "step": 112 }, { "epoch": 0.31564245810055863, "grad_norm": 324.0819396972656, "learning_rate": 1.3687150837988826e-06, "logits/chosen": -0.416015625, "logits/rejected": -0.39453125, "logps/chosen": -109.5, "logps/rejected": -116.0, "loss": 16.9995, "rewards/accuracies": 0.71875, "rewards/chosen": -0.60546875, "rewards/margins": 0.61328125, "rewards/rejected": -1.21875, "step": 113 }, { "epoch": 0.31843575418994413, "grad_norm": 305.16729736328125, "learning_rate": 1.3631284916201116e-06, "logits/chosen": -0.41015625, "logits/rejected": -0.46875, "logps/chosen": -94.0, "logps/rejected": -126.0, "loss": 17.9336, "rewards/accuracies": 0.71875, "rewards/chosen": -0.5859375, "rewards/margins": 0.52734375, "rewards/rejected": -1.109375, "step": 114 }, { "epoch": 0.32122905027932963, "grad_norm": 286.9382629394531, "learning_rate": 1.3575418994413408e-06, "logits/chosen": -0.4140625, "logits/rejected": -0.4296875, "logps/chosen": -96.0, "logps/rejected": -101.0, "loss": 16.5732, "rewards/accuracies": 0.6875, "rewards/chosen": -0.578125, "rewards/margins": 0.63671875, "rewards/rejected": -1.2109375, "step": 115 }, { "epoch": 0.3240223463687151, "grad_norm": 280.4804992675781, "learning_rate": 1.3519553072625697e-06, "logits/chosen": -0.3984375, "logits/rejected": -0.427734375, "logps/chosen": -92.5, "logps/rejected": -98.5, "loss": 17.7627, "rewards/accuracies": 0.6875, "rewards/chosen": -0.671875, "rewards/margins": 0.478515625, "rewards/rejected": -1.1484375, "step": 116 }, { "epoch": 0.3268156424581006, "grad_norm": 376.8148498535156, "learning_rate": 1.3463687150837987e-06, "logits/chosen": -0.416015625, "logits/rejected": -0.380859375, "logps/chosen": -95.5, "logps/rejected": -99.0, "loss": 20.9121, "rewards/accuracies": 0.59375, "rewards/chosen": -0.6875, "rewards/margins": 0.357421875, "rewards/rejected": -1.046875, "step": 117 }, { "epoch": 0.329608938547486, "grad_norm": 320.0467529296875, "learning_rate": 1.3407821229050277e-06, "logits/chosen": -0.375, "logits/rejected": -0.3671875, "logps/chosen": -82.5, "logps/rejected": -161.0, "loss": 18.8989, "rewards/accuracies": 0.59375, "rewards/chosen": -0.78125, "rewards/margins": 0.4140625, "rewards/rejected": -1.1953125, "step": 118 }, { "epoch": 0.3324022346368715, "grad_norm": 333.9539489746094, "learning_rate": 1.335195530726257e-06, "logits/chosen": -0.390625, "logits/rejected": -0.373046875, "logps/chosen": -98.5, "logps/rejected": -120.0, "loss": 18.3311, "rewards/accuracies": 0.59375, "rewards/chosen": -0.5859375, "rewards/margins": 0.474609375, "rewards/rejected": -1.0625, "step": 119 }, { "epoch": 0.33519553072625696, "grad_norm": 253.37940979003906, "learning_rate": 1.329608938547486e-06, "logits/chosen": -0.345703125, "logits/rejected": -0.3984375, "logps/chosen": -83.5, "logps/rejected": -112.5, "loss": 14.2749, "rewards/accuracies": 0.78125, "rewards/chosen": -0.443359375, "rewards/margins": 0.87109375, "rewards/rejected": -1.3203125, "step": 120 }, { "epoch": 0.33798882681564246, "grad_norm": 303.1835632324219, "learning_rate": 1.324022346368715e-06, "logits/chosen": -0.40234375, "logits/rejected": -0.37109375, "logps/chosen": -103.0, "logps/rejected": -125.5, "loss": 16.6855, "rewards/accuracies": 0.65625, "rewards/chosen": -0.6015625, "rewards/margins": 0.62890625, "rewards/rejected": -1.234375, "step": 121 }, { "epoch": 0.3407821229050279, "grad_norm": 330.5453796386719, "learning_rate": 1.318435754189944e-06, "logits/chosen": -0.376953125, "logits/rejected": -0.37109375, "logps/chosen": -87.5, "logps/rejected": -112.5, "loss": 20.5725, "rewards/accuracies": 0.59375, "rewards/chosen": -0.80859375, "rewards/margins": 0.345703125, "rewards/rejected": -1.15625, "step": 122 }, { "epoch": 0.3435754189944134, "grad_norm": 366.5975646972656, "learning_rate": 1.312849162011173e-06, "logits/chosen": -0.361328125, "logits/rejected": -0.412109375, "logps/chosen": -101.5, "logps/rejected": -109.5, "loss": 16.9993, "rewards/accuracies": 0.78125, "rewards/chosen": -0.59765625, "rewards/margins": 0.6328125, "rewards/rejected": -1.2265625, "step": 123 }, { "epoch": 0.3463687150837989, "grad_norm": 365.4494934082031, "learning_rate": 1.3072625698324022e-06, "logits/chosen": -0.361328125, "logits/rejected": -0.375, "logps/chosen": -95.5, "logps/rejected": -104.5, "loss": 17.2153, "rewards/accuracies": 0.6875, "rewards/chosen": -0.671875, "rewards/margins": 0.671875, "rewards/rejected": -1.34375, "step": 124 }, { "epoch": 0.34916201117318435, "grad_norm": 269.4816589355469, "learning_rate": 1.3016759776536311e-06, "logits/chosen": -0.37109375, "logits/rejected": -0.392578125, "logps/chosen": -100.5, "logps/rejected": -110.5, "loss": 13.7074, "rewards/accuracies": 0.8125, "rewards/chosen": -0.53125, "rewards/margins": 0.97265625, "rewards/rejected": -1.5078125, "step": 125 }, { "epoch": 0.35195530726256985, "grad_norm": 330.67877197265625, "learning_rate": 1.2960893854748603e-06, "logits/chosen": -0.3984375, "logits/rejected": -0.396484375, "logps/chosen": -96.5, "logps/rejected": -107.5, "loss": 18.3887, "rewards/accuracies": 0.65625, "rewards/chosen": -0.81640625, "rewards/margins": 0.494140625, "rewards/rejected": -1.3125, "step": 126 }, { "epoch": 0.3547486033519553, "grad_norm": 342.4529113769531, "learning_rate": 1.2905027932960893e-06, "logits/chosen": -0.396484375, "logits/rejected": -0.38671875, "logps/chosen": -94.0, "logps/rejected": -121.5, "loss": 17.0908, "rewards/accuracies": 0.75, "rewards/chosen": -0.7109375, "rewards/margins": 0.59765625, "rewards/rejected": -1.3046875, "step": 127 }, { "epoch": 0.3575418994413408, "grad_norm": 360.07452392578125, "learning_rate": 1.2849162011173185e-06, "logits/chosen": -0.390625, "logits/rejected": -0.419921875, "logps/chosen": -102.5, "logps/rejected": -110.0, "loss": 15.6135, "rewards/accuracies": 0.78125, "rewards/chosen": -0.71484375, "rewards/margins": 0.87109375, "rewards/rejected": -1.5859375, "step": 128 }, { "epoch": 0.36033519553072624, "grad_norm": 291.1601257324219, "learning_rate": 1.2793296089385475e-06, "logits/chosen": -0.365234375, "logits/rejected": -0.36328125, "logps/chosen": -91.0, "logps/rejected": -111.0, "loss": 14.6064, "rewards/accuracies": 0.78125, "rewards/chosen": -0.62109375, "rewards/margins": 0.7890625, "rewards/rejected": -1.40625, "step": 129 }, { "epoch": 0.36312849162011174, "grad_norm": 292.7379150390625, "learning_rate": 1.2737430167597764e-06, "logits/chosen": -0.40625, "logits/rejected": -0.44140625, "logps/chosen": -93.5, "logps/rejected": -119.5, "loss": 18.8181, "rewards/accuracies": 0.53125, "rewards/chosen": -0.828125, "rewards/margins": 0.4375, "rewards/rejected": -1.265625, "step": 130 }, { "epoch": 0.3659217877094972, "grad_norm": 251.2760009765625, "learning_rate": 1.2681564245810054e-06, "logits/chosen": -0.34375, "logits/rejected": -0.400390625, "logps/chosen": -86.5, "logps/rejected": -110.5, "loss": 13.6857, "rewards/accuracies": 0.84375, "rewards/chosen": -0.52734375, "rewards/margins": 0.9765625, "rewards/rejected": -1.5078125, "step": 131 }, { "epoch": 0.3687150837988827, "grad_norm": 345.1154479980469, "learning_rate": 1.2625698324022344e-06, "logits/chosen": -0.39453125, "logits/rejected": -0.416015625, "logps/chosen": -85.0, "logps/rejected": -88.0, "loss": 17.9673, "rewards/accuracies": 0.65625, "rewards/chosen": -0.58984375, "rewards/margins": 0.546875, "rewards/rejected": -1.1328125, "step": 132 }, { "epoch": 0.3715083798882682, "grad_norm": 265.3186950683594, "learning_rate": 1.2569832402234638e-06, "logits/chosen": -0.376953125, "logits/rejected": -0.400390625, "logps/chosen": -87.0, "logps/rejected": -92.0, "loss": 15.9634, "rewards/accuracies": 0.78125, "rewards/chosen": -0.462890625, "rewards/margins": 0.69140625, "rewards/rejected": -1.15625, "step": 133 }, { "epoch": 0.3743016759776536, "grad_norm": 321.3518371582031, "learning_rate": 1.2513966480446928e-06, "logits/chosen": -0.380859375, "logits/rejected": -0.3828125, "logps/chosen": -89.5, "logps/rejected": -125.5, "loss": 16.55, "rewards/accuracies": 0.75, "rewards/chosen": -0.73046875, "rewards/margins": 0.65234375, "rewards/rejected": -1.3828125, "step": 134 }, { "epoch": 0.3770949720670391, "grad_norm": 402.9940490722656, "learning_rate": 1.2458100558659217e-06, "logits/chosen": -0.443359375, "logits/rejected": -0.44140625, "logps/chosen": -104.5, "logps/rejected": -115.0, "loss": 20.1943, "rewards/accuracies": 0.625, "rewards/chosen": -0.8828125, "rewards/margins": 0.53515625, "rewards/rejected": -1.421875, "step": 135 }, { "epoch": 0.37988826815642457, "grad_norm": 279.87054443359375, "learning_rate": 1.2402234636871507e-06, "logits/chosen": -0.423828125, "logits/rejected": -0.408203125, "logps/chosen": -94.0, "logps/rejected": -109.0, "loss": 15.3137, "rewards/accuracies": 0.65625, "rewards/chosen": -0.609375, "rewards/margins": 0.81640625, "rewards/rejected": -1.4296875, "step": 136 }, { "epoch": 0.38268156424581007, "grad_norm": 276.0908203125, "learning_rate": 1.2346368715083799e-06, "logits/chosen": -0.4453125, "logits/rejected": -0.41796875, "logps/chosen": -85.0, "logps/rejected": -110.5, "loss": 18.3452, "rewards/accuracies": 0.78125, "rewards/chosen": -0.72265625, "rewards/margins": 0.5, "rewards/rejected": -1.2265625, "step": 137 }, { "epoch": 0.3854748603351955, "grad_norm": 316.9288635253906, "learning_rate": 1.2290502793296089e-06, "logits/chosen": -0.423828125, "logits/rejected": -0.375, "logps/chosen": -104.0, "logps/rejected": -100.0, "loss": 18.749, "rewards/accuracies": 0.6875, "rewards/chosen": -0.71484375, "rewards/margins": 0.50390625, "rewards/rejected": -1.21875, "step": 138 }, { "epoch": 0.388268156424581, "grad_norm": 338.4888916015625, "learning_rate": 1.2234636871508378e-06, "logits/chosen": -0.451171875, "logits/rejected": -0.4453125, "logps/chosen": -113.0, "logps/rejected": -127.0, "loss": 15.2935, "rewards/accuracies": 0.78125, "rewards/chosen": -0.51953125, "rewards/margins": 0.8359375, "rewards/rejected": -1.359375, "step": 139 }, { "epoch": 0.39106145251396646, "grad_norm": 326.1065673828125, "learning_rate": 1.217877094972067e-06, "logits/chosen": -0.404296875, "logits/rejected": -0.41796875, "logps/chosen": -102.5, "logps/rejected": -125.5, "loss": 15.3799, "rewards/accuracies": 0.75, "rewards/chosen": -0.51953125, "rewards/margins": 0.828125, "rewards/rejected": -1.3515625, "step": 140 }, { "epoch": 0.39385474860335196, "grad_norm": 302.59222412109375, "learning_rate": 1.2122905027932962e-06, "logits/chosen": -0.41015625, "logits/rejected": -0.44921875, "logps/chosen": -93.5, "logps/rejected": -98.0, "loss": 18.5742, "rewards/accuracies": 0.625, "rewards/chosen": -0.70703125, "rewards/margins": 0.453125, "rewards/rejected": -1.1640625, "step": 141 }, { "epoch": 0.39664804469273746, "grad_norm": 444.00177001953125, "learning_rate": 1.2067039106145252e-06, "logits/chosen": -0.435546875, "logits/rejected": -0.40625, "logps/chosen": -116.0, "logps/rejected": -112.0, "loss": 20.0082, "rewards/accuracies": 0.6875, "rewards/chosen": -0.91796875, "rewards/margins": 0.51171875, "rewards/rejected": -1.4296875, "step": 142 }, { "epoch": 0.3994413407821229, "grad_norm": 337.2214660644531, "learning_rate": 1.2011173184357542e-06, "logits/chosen": -0.408203125, "logits/rejected": -0.341796875, "logps/chosen": -120.0, "logps/rejected": -119.0, "loss": 16.4722, "rewards/accuracies": 0.75, "rewards/chosen": -0.6875, "rewards/margins": 0.66015625, "rewards/rejected": -1.34375, "step": 143 }, { "epoch": 0.4022346368715084, "grad_norm": 253.4144287109375, "learning_rate": 1.1955307262569831e-06, "logits/chosen": -0.404296875, "logits/rejected": -0.373046875, "logps/chosen": -102.5, "logps/rejected": -139.0, "loss": 15.3838, "rewards/accuracies": 0.75, "rewards/chosen": -0.65625, "rewards/margins": 0.80859375, "rewards/rejected": -1.4609375, "step": 144 }, { "epoch": 0.40502793296089384, "grad_norm": 324.1391296386719, "learning_rate": 1.189944134078212e-06, "logits/chosen": -0.400390625, "logits/rejected": -0.359375, "logps/chosen": -109.0, "logps/rejected": -102.5, "loss": 17.4725, "rewards/accuracies": 0.71875, "rewards/chosen": -0.4921875, "rewards/margins": 0.67578125, "rewards/rejected": -1.171875, "step": 145 }, { "epoch": 0.40782122905027934, "grad_norm": 347.2724609375, "learning_rate": 1.1843575418994413e-06, "logits/chosen": -0.357421875, "logits/rejected": -0.36328125, "logps/chosen": -100.5, "logps/rejected": -115.5, "loss": 16.8071, "rewards/accuracies": 0.71875, "rewards/chosen": -0.78125, "rewards/margins": 0.65234375, "rewards/rejected": -1.4296875, "step": 146 }, { "epoch": 0.4106145251396648, "grad_norm": 279.97125244140625, "learning_rate": 1.1787709497206705e-06, "logits/chosen": -0.38671875, "logits/rejected": -0.376953125, "logps/chosen": -91.0, "logps/rejected": -105.0, "loss": 16.4648, "rewards/accuracies": 0.75, "rewards/chosen": -0.65625, "rewards/margins": 0.69921875, "rewards/rejected": -1.359375, "step": 147 }, { "epoch": 0.4134078212290503, "grad_norm": 236.11715698242188, "learning_rate": 1.1731843575418994e-06, "logits/chosen": -0.357421875, "logits/rejected": -0.39453125, "logps/chosen": -88.0, "logps/rejected": -159.0, "loss": 10.6122, "rewards/accuracies": 0.84375, "rewards/chosen": -0.30078125, "rewards/margins": 1.3125, "rewards/rejected": -1.6171875, "step": 148 }, { "epoch": 0.41620111731843573, "grad_norm": 362.3569030761719, "learning_rate": 1.1675977653631284e-06, "logits/chosen": -0.40625, "logits/rejected": -0.427734375, "logps/chosen": -111.5, "logps/rejected": -107.0, "loss": 20.7761, "rewards/accuracies": 0.5625, "rewards/chosen": -0.6953125, "rewards/margins": 0.400390625, "rewards/rejected": -1.09375, "step": 149 }, { "epoch": 0.41899441340782123, "grad_norm": 266.2090148925781, "learning_rate": 1.1620111731843576e-06, "logits/chosen": -0.431640625, "logits/rejected": -0.42578125, "logps/chosen": -88.5, "logps/rejected": -97.0, "loss": 16.3364, "rewards/accuracies": 0.75, "rewards/chosen": -0.384765625, "rewards/margins": 0.765625, "rewards/rejected": -1.1484375, "step": 150 }, { "epoch": 0.42178770949720673, "grad_norm": 276.038330078125, "learning_rate": 1.1564245810055866e-06, "logits/chosen": -0.365234375, "logits/rejected": -0.37890625, "logps/chosen": -93.5, "logps/rejected": -99.0, "loss": 16.6824, "rewards/accuracies": 0.75, "rewards/chosen": -0.61328125, "rewards/margins": 0.68359375, "rewards/rejected": -1.296875, "step": 151 }, { "epoch": 0.4245810055865922, "grad_norm": 337.5898742675781, "learning_rate": 1.1508379888268155e-06, "logits/chosen": -0.400390625, "logits/rejected": -0.390625, "logps/chosen": -99.0, "logps/rejected": -125.0, "loss": 15.1602, "rewards/accuracies": 0.75, "rewards/chosen": -0.57421875, "rewards/margins": 0.87109375, "rewards/rejected": -1.4453125, "step": 152 }, { "epoch": 0.4273743016759777, "grad_norm": 292.1264953613281, "learning_rate": 1.1452513966480445e-06, "logits/chosen": -0.3984375, "logits/rejected": -0.408203125, "logps/chosen": -89.5, "logps/rejected": -116.0, "loss": 14.3208, "rewards/accuracies": 0.78125, "rewards/chosen": -0.490234375, "rewards/margins": 0.890625, "rewards/rejected": -1.3828125, "step": 153 }, { "epoch": 0.4301675977653631, "grad_norm": 332.5009765625, "learning_rate": 1.1396648044692735e-06, "logits/chosen": -0.42578125, "logits/rejected": -0.44921875, "logps/chosen": -88.5, "logps/rejected": -120.5, "loss": 19.6897, "rewards/accuracies": 0.625, "rewards/chosen": -0.6796875, "rewards/margins": 0.435546875, "rewards/rejected": -1.1171875, "step": 154 }, { "epoch": 0.4329608938547486, "grad_norm": 280.05340576171875, "learning_rate": 1.1340782122905029e-06, "logits/chosen": -0.48828125, "logits/rejected": -0.478515625, "logps/chosen": -89.0, "logps/rejected": -134.0, "loss": 17.045, "rewards/accuracies": 0.8125, "rewards/chosen": -0.6875, "rewards/margins": 0.70703125, "rewards/rejected": -1.3984375, "step": 155 }, { "epoch": 0.43575418994413406, "grad_norm": 304.7948303222656, "learning_rate": 1.1284916201117319e-06, "logits/chosen": -0.38671875, "logits/rejected": -0.37890625, "logps/chosen": -91.5, "logps/rejected": -118.5, "loss": 13.1472, "rewards/accuracies": 0.75, "rewards/chosen": -0.28515625, "rewards/margins": 1.0078125, "rewards/rejected": -1.2890625, "step": 156 }, { "epoch": 0.43854748603351956, "grad_norm": 349.6177673339844, "learning_rate": 1.1229050279329608e-06, "logits/chosen": -0.359375, "logits/rejected": -0.37109375, "logps/chosen": -97.5, "logps/rejected": -107.0, "loss": 16.024, "rewards/accuracies": 0.75, "rewards/chosen": -0.46484375, "rewards/margins": 0.82421875, "rewards/rejected": -1.2890625, "step": 157 }, { "epoch": 0.441340782122905, "grad_norm": 401.85784912109375, "learning_rate": 1.1173184357541898e-06, "logits/chosen": -0.412109375, "logits/rejected": -0.412109375, "logps/chosen": -101.0, "logps/rejected": -108.5, "loss": 18.879, "rewards/accuracies": 0.625, "rewards/chosen": -0.73046875, "rewards/margins": 0.546875, "rewards/rejected": -1.28125, "step": 158 }, { "epoch": 0.4441340782122905, "grad_norm": 316.90533447265625, "learning_rate": 1.111731843575419e-06, "logits/chosen": -0.40625, "logits/rejected": -0.412109375, "logps/chosen": -93.0, "logps/rejected": -119.0, "loss": 15.4336, "rewards/accuracies": 0.75, "rewards/chosen": -0.51953125, "rewards/margins": 0.83984375, "rewards/rejected": -1.359375, "step": 159 }, { "epoch": 0.44692737430167595, "grad_norm": 446.0115966796875, "learning_rate": 1.106145251396648e-06, "logits/chosen": -0.478515625, "logits/rejected": -0.46875, "logps/chosen": -122.0, "logps/rejected": -122.0, "loss": 21.0449, "rewards/accuracies": 0.625, "rewards/chosen": -0.875, "rewards/margins": 0.39453125, "rewards/rejected": -1.265625, "step": 160 }, { "epoch": 0.44972067039106145, "grad_norm": 283.9158935546875, "learning_rate": 1.100558659217877e-06, "logits/chosen": -0.419921875, "logits/rejected": -0.427734375, "logps/chosen": -95.0, "logps/rejected": -117.0, "loss": 13.5156, "rewards/accuracies": 0.78125, "rewards/chosen": -0.41796875, "rewards/margins": 1.046875, "rewards/rejected": -1.46875, "step": 161 }, { "epoch": 0.45251396648044695, "grad_norm": 343.8311462402344, "learning_rate": 1.0949720670391061e-06, "logits/chosen": -0.37890625, "logits/rejected": -0.35546875, "logps/chosen": -99.0, "logps/rejected": -99.5, "loss": 19.0415, "rewards/accuracies": 0.625, "rewards/chosen": -0.68359375, "rewards/margins": 0.416015625, "rewards/rejected": -1.09375, "step": 162 }, { "epoch": 0.4553072625698324, "grad_norm": 308.7500305175781, "learning_rate": 1.0893854748603351e-06, "logits/chosen": -0.40625, "logits/rejected": -0.40234375, "logps/chosen": -86.5, "logps/rejected": -109.5, "loss": 15.4565, "rewards/accuracies": 0.75, "rewards/chosen": -0.65234375, "rewards/margins": 0.7109375, "rewards/rejected": -1.359375, "step": 163 }, { "epoch": 0.4581005586592179, "grad_norm": 317.210693359375, "learning_rate": 1.0837988826815643e-06, "logits/chosen": -0.404296875, "logits/rejected": -0.408203125, "logps/chosen": -98.5, "logps/rejected": -102.0, "loss": 15.2539, "rewards/accuracies": 0.8125, "rewards/chosen": -0.40625, "rewards/margins": 0.80859375, "rewards/rejected": -1.2109375, "step": 164 }, { "epoch": 0.46089385474860334, "grad_norm": 289.8725280761719, "learning_rate": 1.0782122905027933e-06, "logits/chosen": -0.3984375, "logits/rejected": -0.404296875, "logps/chosen": -105.0, "logps/rejected": -100.5, "loss": 14.4402, "rewards/accuracies": 0.6875, "rewards/chosen": -0.3515625, "rewards/margins": 0.9609375, "rewards/rejected": -1.3125, "step": 165 }, { "epoch": 0.46368715083798884, "grad_norm": 318.3322448730469, "learning_rate": 1.0726256983240222e-06, "logits/chosen": -0.44921875, "logits/rejected": -0.435546875, "logps/chosen": -94.5, "logps/rejected": -108.5, "loss": 17.6035, "rewards/accuracies": 0.65625, "rewards/chosen": -0.66015625, "rewards/margins": 0.72265625, "rewards/rejected": -1.3828125, "step": 166 }, { "epoch": 0.4664804469273743, "grad_norm": 424.1824035644531, "learning_rate": 1.0670391061452512e-06, "logits/chosen": -0.390625, "logits/rejected": -0.38671875, "logps/chosen": -115.5, "logps/rejected": -116.5, "loss": 20.4692, "rewards/accuracies": 0.71875, "rewards/chosen": -0.6640625, "rewards/margins": 0.388671875, "rewards/rejected": -1.0546875, "step": 167 }, { "epoch": 0.4692737430167598, "grad_norm": 299.5821838378906, "learning_rate": 1.0614525139664804e-06, "logits/chosen": -0.369140625, "logits/rejected": -0.3671875, "logps/chosen": -110.0, "logps/rejected": -107.5, "loss": 14.8943, "rewards/accuracies": 0.71875, "rewards/chosen": -0.5625, "rewards/margins": 0.890625, "rewards/rejected": -1.453125, "step": 168 }, { "epoch": 0.4720670391061452, "grad_norm": 401.1424560546875, "learning_rate": 1.0558659217877096e-06, "logits/chosen": -0.390625, "logits/rejected": -0.390625, "logps/chosen": -119.5, "logps/rejected": -123.0, "loss": 18.4705, "rewards/accuracies": 0.625, "rewards/chosen": -0.921875, "rewards/margins": 0.4921875, "rewards/rejected": -1.4140625, "step": 169 }, { "epoch": 0.4748603351955307, "grad_norm": 289.37078857421875, "learning_rate": 1.0502793296089386e-06, "logits/chosen": -0.369140625, "logits/rejected": -0.416015625, "logps/chosen": -83.0, "logps/rejected": -107.5, "loss": 14.9119, "rewards/accuracies": 0.71875, "rewards/chosen": -0.443359375, "rewards/margins": 0.94921875, "rewards/rejected": -1.390625, "step": 170 }, { "epoch": 0.4776536312849162, "grad_norm": 266.201171875, "learning_rate": 1.0446927374301675e-06, "logits/chosen": -0.408203125, "logits/rejected": -0.4140625, "logps/chosen": -105.0, "logps/rejected": -107.0, "loss": 14.2812, "rewards/accuracies": 0.84375, "rewards/chosen": -0.54296875, "rewards/margins": 0.796875, "rewards/rejected": -1.34375, "step": 171 }, { "epoch": 0.48044692737430167, "grad_norm": 299.2616271972656, "learning_rate": 1.0391061452513965e-06, "logits/chosen": -0.359375, "logits/rejected": -0.416015625, "logps/chosen": -92.0, "logps/rejected": -102.0, "loss": 14.8467, "rewards/accuracies": 0.71875, "rewards/chosen": -0.34765625, "rewards/margins": 0.8203125, "rewards/rejected": -1.171875, "step": 172 }, { "epoch": 0.48324022346368717, "grad_norm": 345.51263427734375, "learning_rate": 1.0335195530726257e-06, "logits/chosen": -0.361328125, "logits/rejected": -0.3828125, "logps/chosen": -103.5, "logps/rejected": -99.0, "loss": 19.4688, "rewards/accuracies": 0.5625, "rewards/chosen": -0.67578125, "rewards/margins": 0.390625, "rewards/rejected": -1.0703125, "step": 173 }, { "epoch": 0.4860335195530726, "grad_norm": 396.66058349609375, "learning_rate": 1.0279329608938547e-06, "logits/chosen": -0.384765625, "logits/rejected": -0.380859375, "logps/chosen": -121.0, "logps/rejected": -134.0, "loss": 17.2842, "rewards/accuracies": 0.71875, "rewards/chosen": -0.87890625, "rewards/margins": 0.66796875, "rewards/rejected": -1.546875, "step": 174 }, { "epoch": 0.4888268156424581, "grad_norm": 312.6742248535156, "learning_rate": 1.0223463687150836e-06, "logits/chosen": -0.43359375, "logits/rejected": -0.44140625, "logps/chosen": -115.5, "logps/rejected": -113.0, "loss": 16.1692, "rewards/accuracies": 0.78125, "rewards/chosen": -0.419921875, "rewards/margins": 0.796875, "rewards/rejected": -1.21875, "step": 175 }, { "epoch": 0.49162011173184356, "grad_norm": 385.5421142578125, "learning_rate": 1.0167597765363128e-06, "logits/chosen": -0.400390625, "logits/rejected": -0.427734375, "logps/chosen": -104.0, "logps/rejected": -114.0, "loss": 18.1244, "rewards/accuracies": 0.65625, "rewards/chosen": -0.640625, "rewards/margins": 0.67578125, "rewards/rejected": -1.3203125, "step": 176 }, { "epoch": 0.49441340782122906, "grad_norm": 387.2543640136719, "learning_rate": 1.011173184357542e-06, "logits/chosen": -0.4296875, "logits/rejected": -0.423828125, "logps/chosen": -95.5, "logps/rejected": -105.0, "loss": 13.7935, "rewards/accuracies": 0.90625, "rewards/chosen": -0.376953125, "rewards/margins": 0.91796875, "rewards/rejected": -1.296875, "step": 177 }, { "epoch": 0.4972067039106145, "grad_norm": 297.4251403808594, "learning_rate": 1.005586592178771e-06, "logits/chosen": -0.41796875, "logits/rejected": -0.451171875, "logps/chosen": -113.0, "logps/rejected": -128.0, "loss": 12.2241, "rewards/accuracies": 0.8125, "rewards/chosen": -0.34375, "rewards/margins": 1.140625, "rewards/rejected": -1.4765625, "step": 178 }, { "epoch": 0.5, "grad_norm": 367.9402770996094, "learning_rate": 1e-06, "logits/chosen": -0.4140625, "logits/rejected": -0.41796875, "logps/chosen": -109.5, "logps/rejected": -114.5, "loss": 17.769, "rewards/accuracies": 0.65625, "rewards/chosen": -0.57421875, "rewards/margins": 0.5859375, "rewards/rejected": -1.1640625, "step": 179 }, { "epoch": 0.5027932960893855, "grad_norm": 291.66009521484375, "learning_rate": 9.94413407821229e-07, "logits/chosen": -0.39453125, "logits/rejected": -0.416015625, "logps/chosen": -88.5, "logps/rejected": -111.5, "loss": 15.0688, "rewards/accuracies": 0.8125, "rewards/chosen": -0.609375, "rewards/margins": 0.8671875, "rewards/rejected": -1.4765625, "step": 180 }, { "epoch": 0.505586592178771, "grad_norm": 335.5206604003906, "learning_rate": 9.888268156424581e-07, "logits/chosen": -0.48046875, "logits/rejected": -0.43359375, "logps/chosen": -94.5, "logps/rejected": -115.0, "loss": 15.7329, "rewards/accuracies": 0.75, "rewards/chosen": -0.6640625, "rewards/margins": 0.93359375, "rewards/rejected": -1.6015625, "step": 181 }, { "epoch": 0.5083798882681564, "grad_norm": 336.9613342285156, "learning_rate": 9.83240223463687e-07, "logits/chosen": -0.44921875, "logits/rejected": -0.412109375, "logps/chosen": -96.0, "logps/rejected": -129.0, "loss": 19.5758, "rewards/accuracies": 0.6875, "rewards/chosen": -0.51171875, "rewards/margins": 0.396484375, "rewards/rejected": -0.91015625, "step": 182 }, { "epoch": 0.5111731843575419, "grad_norm": 268.0111083984375, "learning_rate": 9.776536312849163e-07, "logits/chosen": -0.380859375, "logits/rejected": -0.447265625, "logps/chosen": -85.5, "logps/rejected": -117.5, "loss": 11.657, "rewards/accuracies": 0.84375, "rewards/chosen": -0.37890625, "rewards/margins": 1.2578125, "rewards/rejected": -1.640625, "step": 183 }, { "epoch": 0.5139664804469274, "grad_norm": 365.27569580078125, "learning_rate": 9.720670391061452e-07, "logits/chosen": -0.40625, "logits/rejected": -0.408203125, "logps/chosen": -101.5, "logps/rejected": -121.0, "loss": 16.0954, "rewards/accuracies": 0.75, "rewards/chosen": -0.482421875, "rewards/margins": 0.90625, "rewards/rejected": -1.390625, "step": 184 }, { "epoch": 0.5167597765363129, "grad_norm": 348.523681640625, "learning_rate": 9.664804469273742e-07, "logits/chosen": -0.41015625, "logits/rejected": -0.431640625, "logps/chosen": -91.5, "logps/rejected": -98.0, "loss": 19.5945, "rewards/accuracies": 0.71875, "rewards/chosen": -0.609375, "rewards/margins": 0.55078125, "rewards/rejected": -1.1640625, "step": 185 }, { "epoch": 0.5195530726256983, "grad_norm": 314.3127136230469, "learning_rate": 9.608938547486032e-07, "logits/chosen": -0.423828125, "logits/rejected": -0.41796875, "logps/chosen": -89.5, "logps/rejected": -113.5, "loss": 15.1895, "rewards/accuracies": 0.71875, "rewards/chosen": -0.2314453125, "rewards/margins": 0.984375, "rewards/rejected": -1.21875, "step": 186 }, { "epoch": 0.5223463687150838, "grad_norm": 397.8481140136719, "learning_rate": 9.553072625698324e-07, "logits/chosen": -0.4140625, "logits/rejected": -0.408203125, "logps/chosen": -108.0, "logps/rejected": -214.0, "loss": 14.7458, "rewards/accuracies": 0.78125, "rewards/chosen": -0.349609375, "rewards/margins": 0.88671875, "rewards/rejected": -1.234375, "step": 187 }, { "epoch": 0.5251396648044693, "grad_norm": 250.88055419921875, "learning_rate": 9.497206703910615e-07, "logits/chosen": -0.41015625, "logits/rejected": -0.41796875, "logps/chosen": -93.0, "logps/rejected": -106.0, "loss": 12.064, "rewards/accuracies": 0.84375, "rewards/chosen": -0.27734375, "rewards/margins": 1.2265625, "rewards/rejected": -1.5, "step": 188 }, { "epoch": 0.5279329608938548, "grad_norm": 265.9867858886719, "learning_rate": 9.441340782122904e-07, "logits/chosen": -0.4140625, "logits/rejected": -0.404296875, "logps/chosen": -106.0, "logps/rejected": -91.0, "loss": 13.7642, "rewards/accuracies": 0.78125, "rewards/chosen": -0.36328125, "rewards/margins": 0.93359375, "rewards/rejected": -1.296875, "step": 189 }, { "epoch": 0.5307262569832403, "grad_norm": 360.5141296386719, "learning_rate": 9.385474860335195e-07, "logits/chosen": -0.44140625, "logits/rejected": -0.478515625, "logps/chosen": -93.0, "logps/rejected": -117.0, "loss": 18.7876, "rewards/accuracies": 0.6875, "rewards/chosen": -0.828125, "rewards/margins": 0.427734375, "rewards/rejected": -1.2578125, "step": 190 }, { "epoch": 0.5335195530726257, "grad_norm": 333.41943359375, "learning_rate": 9.329608938547485e-07, "logits/chosen": -0.439453125, "logits/rejected": -0.4296875, "logps/chosen": -85.5, "logps/rejected": -96.5, "loss": 19.4559, "rewards/accuracies": 0.5625, "rewards/chosen": -0.63671875, "rewards/margins": 0.53515625, "rewards/rejected": -1.171875, "step": 191 }, { "epoch": 0.5363128491620112, "grad_norm": 292.119140625, "learning_rate": 9.273743016759777e-07, "logits/chosen": -0.474609375, "logits/rejected": -0.443359375, "logps/chosen": -96.5, "logps/rejected": -111.5, "loss": 14.4514, "rewards/accuracies": 0.78125, "rewards/chosen": -0.5234375, "rewards/margins": 0.8984375, "rewards/rejected": -1.421875, "step": 192 }, { "epoch": 0.5391061452513967, "grad_norm": 305.8288269042969, "learning_rate": 9.217877094972066e-07, "logits/chosen": -0.4453125, "logits/rejected": -0.462890625, "logps/chosen": -85.0, "logps/rejected": -105.5, "loss": 16.8213, "rewards/accuracies": 0.75, "rewards/chosen": -0.482421875, "rewards/margins": 0.765625, "rewards/rejected": -1.2421875, "step": 193 }, { "epoch": 0.5418994413407822, "grad_norm": 298.0262756347656, "learning_rate": 9.162011173184357e-07, "logits/chosen": -0.439453125, "logits/rejected": -0.412109375, "logps/chosen": -102.5, "logps/rejected": -105.0, "loss": 16.8218, "rewards/accuracies": 0.78125, "rewards/chosen": -0.578125, "rewards/margins": 0.6171875, "rewards/rejected": -1.1953125, "step": 194 }, { "epoch": 0.5446927374301676, "grad_norm": 316.2427978515625, "learning_rate": 9.106145251396647e-07, "logits/chosen": -0.466796875, "logits/rejected": -0.4609375, "logps/chosen": -83.5, "logps/rejected": -101.5, "loss": 18.8521, "rewards/accuracies": 0.65625, "rewards/chosen": -0.765625, "rewards/margins": 0.37890625, "rewards/rejected": -1.1484375, "step": 195 }, { "epoch": 0.547486033519553, "grad_norm": 394.1368408203125, "learning_rate": 9.050279329608939e-07, "logits/chosen": -0.408203125, "logits/rejected": -0.44921875, "logps/chosen": -94.0, "logps/rejected": -126.5, "loss": 16.7463, "rewards/accuracies": 0.71875, "rewards/chosen": -0.46875, "rewards/margins": 0.75, "rewards/rejected": -1.21875, "step": 196 }, { "epoch": 0.5502793296089385, "grad_norm": 400.6241149902344, "learning_rate": 8.994413407821229e-07, "logits/chosen": -0.453125, "logits/rejected": -0.484375, "logps/chosen": -103.5, "logps/rejected": -98.5, "loss": 18.2542, "rewards/accuracies": 0.625, "rewards/chosen": -0.68359375, "rewards/margins": 0.5859375, "rewards/rejected": -1.265625, "step": 197 }, { "epoch": 0.553072625698324, "grad_norm": 322.0867614746094, "learning_rate": 8.938547486033518e-07, "logits/chosen": -0.416015625, "logits/rejected": -0.435546875, "logps/chosen": -92.0, "logps/rejected": -106.0, "loss": 17.7424, "rewards/accuracies": 0.71875, "rewards/chosen": -0.51171875, "rewards/margins": 0.62890625, "rewards/rejected": -1.140625, "step": 198 }, { "epoch": 0.5558659217877095, "grad_norm": 411.21173095703125, "learning_rate": 8.88268156424581e-07, "logits/chosen": -0.451171875, "logits/rejected": -0.48046875, "logps/chosen": -79.5, "logps/rejected": -109.5, "loss": 21.2289, "rewards/accuracies": 0.5, "rewards/chosen": -0.4609375, "rewards/margins": 0.447265625, "rewards/rejected": -0.91015625, "step": 199 }, { "epoch": 0.5586592178770949, "grad_norm": 318.6951599121094, "learning_rate": 8.8268156424581e-07, "logits/chosen": -0.443359375, "logits/rejected": -0.4296875, "logps/chosen": -102.0, "logps/rejected": -100.5, "loss": 15.1863, "rewards/accuracies": 0.71875, "rewards/chosen": -0.28125, "rewards/margins": 0.91796875, "rewards/rejected": -1.1953125, "step": 200 }, { "epoch": 0.5614525139664804, "grad_norm": 287.7660217285156, "learning_rate": 8.770949720670391e-07, "logits/chosen": -0.431640625, "logits/rejected": -0.44140625, "logps/chosen": -85.5, "logps/rejected": -93.5, "loss": 14.8735, "rewards/accuracies": 0.75, "rewards/chosen": -0.15625, "rewards/margins": 0.93359375, "rewards/rejected": -1.0859375, "step": 201 }, { "epoch": 0.5642458100558659, "grad_norm": 368.2282409667969, "learning_rate": 8.71508379888268e-07, "logits/chosen": -0.47265625, "logits/rejected": -0.474609375, "logps/chosen": -100.0, "logps/rejected": -90.0, "loss": 19.8105, "rewards/accuracies": 0.59375, "rewards/chosen": -0.51953125, "rewards/margins": 0.458984375, "rewards/rejected": -0.98046875, "step": 202 }, { "epoch": 0.5670391061452514, "grad_norm": 332.07452392578125, "learning_rate": 8.659217877094972e-07, "logits/chosen": -0.375, "logits/rejected": -0.462890625, "logps/chosen": -90.5, "logps/rejected": -98.0, "loss": 20.9299, "rewards/accuracies": 0.65625, "rewards/chosen": -0.376953125, "rewards/margins": 0.46875, "rewards/rejected": -0.84765625, "step": 203 }, { "epoch": 0.5698324022346368, "grad_norm": 275.5162048339844, "learning_rate": 8.603351955307262e-07, "logits/chosen": -0.48046875, "logits/rejected": -0.462890625, "logps/chosen": -83.5, "logps/rejected": -96.0, "loss": 15.6311, "rewards/accuracies": 0.6875, "rewards/chosen": -0.32421875, "rewards/margins": 0.8203125, "rewards/rejected": -1.140625, "step": 204 }, { "epoch": 0.5726256983240223, "grad_norm": 320.8607482910156, "learning_rate": 8.547486033519553e-07, "logits/chosen": -0.4453125, "logits/rejected": -0.43359375, "logps/chosen": -100.0, "logps/rejected": -105.5, "loss": 15.0579, "rewards/accuracies": 0.8125, "rewards/chosen": -0.388671875, "rewards/margins": 0.9609375, "rewards/rejected": -1.3515625, "step": 205 }, { "epoch": 0.5754189944134078, "grad_norm": 449.83056640625, "learning_rate": 8.491620111731844e-07, "logits/chosen": -0.5, "logits/rejected": -0.47265625, "logps/chosen": -119.5, "logps/rejected": -115.5, "loss": 16.0839, "rewards/accuracies": 0.71875, "rewards/chosen": -0.361328125, "rewards/margins": 0.78125, "rewards/rejected": -1.140625, "step": 206 }, { "epoch": 0.5782122905027933, "grad_norm": 387.1114501953125, "learning_rate": 8.435754189944134e-07, "logits/chosen": -0.412109375, "logits/rejected": -0.40625, "logps/chosen": -85.0, "logps/rejected": -90.5, "loss": 21.6782, "rewards/accuracies": 0.5625, "rewards/chosen": -0.421875, "rewards/margins": 0.294921875, "rewards/rejected": -0.71875, "step": 207 }, { "epoch": 0.5810055865921788, "grad_norm": 304.0159912109375, "learning_rate": 8.379888268156424e-07, "logits/chosen": -0.50390625, "logits/rejected": -0.4765625, "logps/chosen": -85.5, "logps/rejected": -124.5, "loss": 12.9265, "rewards/accuracies": 0.84375, "rewards/chosen": -0.34375, "rewards/margins": 1.09375, "rewards/rejected": -1.4375, "step": 208 }, { "epoch": 0.5837988826815642, "grad_norm": 295.77545166015625, "learning_rate": 8.324022346368714e-07, "logits/chosen": -0.431640625, "logits/rejected": -0.462890625, "logps/chosen": -109.5, "logps/rejected": -100.5, "loss": 13.1455, "rewards/accuracies": 0.78125, "rewards/chosen": -0.134765625, "rewards/margins": 1.0703125, "rewards/rejected": -1.203125, "step": 209 }, { "epoch": 0.5865921787709497, "grad_norm": 291.8238830566406, "learning_rate": 8.268156424581006e-07, "logits/chosen": -0.4609375, "logits/rejected": -0.412109375, "logps/chosen": -88.5, "logps/rejected": -96.5, "loss": 16.688, "rewards/accuracies": 0.75, "rewards/chosen": -0.44921875, "rewards/margins": 0.6171875, "rewards/rejected": -1.0625, "step": 210 }, { "epoch": 0.5893854748603352, "grad_norm": 363.25628662109375, "learning_rate": 8.212290502793295e-07, "logits/chosen": -0.44140625, "logits/rejected": -0.431640625, "logps/chosen": -96.5, "logps/rejected": -96.0, "loss": 17.7532, "rewards/accuracies": 0.71875, "rewards/chosen": -0.11474609375, "rewards/margins": 0.609375, "rewards/rejected": -0.7265625, "step": 211 }, { "epoch": 0.5921787709497207, "grad_norm": 249.58558654785156, "learning_rate": 8.156424581005586e-07, "logits/chosen": -0.4453125, "logits/rejected": -0.466796875, "logps/chosen": -86.0, "logps/rejected": -111.5, "loss": 12.7819, "rewards/accuracies": 0.8125, "rewards/chosen": -0.1943359375, "rewards/margins": 1.0390625, "rewards/rejected": -1.234375, "step": 212 }, { "epoch": 0.5949720670391061, "grad_norm": 314.7393798828125, "learning_rate": 8.100558659217876e-07, "logits/chosen": -0.474609375, "logits/rejected": -0.470703125, "logps/chosen": -92.5, "logps/rejected": -92.5, "loss": 18.1631, "rewards/accuracies": 0.71875, "rewards/chosen": -0.22265625, "rewards/margins": 0.609375, "rewards/rejected": -0.83203125, "step": 213 }, { "epoch": 0.5977653631284916, "grad_norm": 302.8637390136719, "learning_rate": 8.044692737430168e-07, "logits/chosen": -0.458984375, "logits/rejected": -0.46875, "logps/chosen": -83.5, "logps/rejected": -99.0, "loss": 15.8152, "rewards/accuracies": 0.8125, "rewards/chosen": -0.294921875, "rewards/margins": 0.8203125, "rewards/rejected": -1.1171875, "step": 214 }, { "epoch": 0.6005586592178771, "grad_norm": 297.88031005859375, "learning_rate": 7.988826815642458e-07, "logits/chosen": -0.47265625, "logits/rejected": -0.46875, "logps/chosen": -100.0, "logps/rejected": -117.0, "loss": 14.1917, "rewards/accuracies": 0.78125, "rewards/chosen": -0.1884765625, "rewards/margins": 1.046875, "rewards/rejected": -1.2421875, "step": 215 }, { "epoch": 0.6033519553072626, "grad_norm": 329.3445739746094, "learning_rate": 7.932960893854748e-07, "logits/chosen": -0.470703125, "logits/rejected": -0.458984375, "logps/chosen": -83.0, "logps/rejected": -112.0, "loss": 14.579, "rewards/accuracies": 0.6875, "rewards/chosen": -0.294921875, "rewards/margins": 1.0078125, "rewards/rejected": -1.3046875, "step": 216 }, { "epoch": 0.6061452513966481, "grad_norm": 406.30078125, "learning_rate": 7.877094972067039e-07, "logits/chosen": -0.416015625, "logits/rejected": -0.419921875, "logps/chosen": -93.0, "logps/rejected": -94.0, "loss": 17.49, "rewards/accuracies": 0.59375, "rewards/chosen": -0.0849609375, "rewards/margins": 0.64453125, "rewards/rejected": -0.73046875, "step": 217 }, { "epoch": 0.6089385474860335, "grad_norm": 356.35614013671875, "learning_rate": 7.821229050279329e-07, "logits/chosen": -0.494140625, "logits/rejected": -0.4609375, "logps/chosen": -94.5, "logps/rejected": -109.5, "loss": 16.4495, "rewards/accuracies": 0.75, "rewards/chosen": -0.29296875, "rewards/margins": 0.69140625, "rewards/rejected": -0.984375, "step": 218 }, { "epoch": 0.611731843575419, "grad_norm": 284.1885070800781, "learning_rate": 7.76536312849162e-07, "logits/chosen": -0.427734375, "logits/rejected": -0.4296875, "logps/chosen": -91.0, "logps/rejected": -103.0, "loss": 16.495, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0245361328125, "rewards/margins": 0.7890625, "rewards/rejected": -0.8125, "step": 219 }, { "epoch": 0.6145251396648045, "grad_norm": 369.37103271484375, "learning_rate": 7.709497206703909e-07, "logits/chosen": -0.466796875, "logits/rejected": -0.470703125, "logps/chosen": -85.5, "logps/rejected": -135.0, "loss": 18.2538, "rewards/accuracies": 0.65625, "rewards/chosen": -0.365234375, "rewards/margins": 0.71875, "rewards/rejected": -1.0859375, "step": 220 }, { "epoch": 0.61731843575419, "grad_norm": 312.0799560546875, "learning_rate": 7.653631284916201e-07, "logits/chosen": -0.423828125, "logits/rejected": -0.431640625, "logps/chosen": -88.0, "logps/rejected": -86.0, "loss": 15.5918, "rewards/accuracies": 0.78125, "rewards/chosen": -0.1376953125, "rewards/margins": 0.7109375, "rewards/rejected": -0.84765625, "step": 221 }, { "epoch": 0.6201117318435754, "grad_norm": 274.8368225097656, "learning_rate": 7.597765363128491e-07, "logits/chosen": -0.4140625, "logits/rejected": -0.443359375, "logps/chosen": -76.0, "logps/rejected": -107.0, "loss": 13.6572, "rewards/accuracies": 0.78125, "rewards/chosen": 0.019287109375, "rewards/margins": 0.89453125, "rewards/rejected": -0.87890625, "step": 222 }, { "epoch": 0.6229050279329609, "grad_norm": 368.5276794433594, "learning_rate": 7.541899441340782e-07, "logits/chosen": -0.392578125, "logits/rejected": -0.427734375, "logps/chosen": -89.5, "logps/rejected": -109.0, "loss": 14.5469, "rewards/accuracies": 0.71875, "rewards/chosen": -0.08935546875, "rewards/margins": 1.171875, "rewards/rejected": -1.2578125, "step": 223 }, { "epoch": 0.6256983240223464, "grad_norm": 360.3989562988281, "learning_rate": 7.486033519553073e-07, "logits/chosen": -0.423828125, "logits/rejected": -0.4609375, "logps/chosen": -118.5, "logps/rejected": -101.5, "loss": 12.9978, "rewards/accuracies": 0.78125, "rewards/chosen": -0.07958984375, "rewards/margins": 1.0078125, "rewards/rejected": -1.0859375, "step": 224 }, { "epoch": 0.6284916201117319, "grad_norm": 334.4165954589844, "learning_rate": 7.430167597765363e-07, "logits/chosen": -0.40234375, "logits/rejected": -0.43359375, "logps/chosen": -115.5, "logps/rejected": -105.0, "loss": 13.4487, "rewards/accuracies": 0.78125, "rewards/chosen": -0.1826171875, "rewards/margins": 0.99609375, "rewards/rejected": -1.1796875, "step": 225 }, { "epoch": 0.6312849162011173, "grad_norm": 331.9964294433594, "learning_rate": 7.374301675977653e-07, "logits/chosen": -0.369140625, "logits/rejected": -0.404296875, "logps/chosen": -86.5, "logps/rejected": -91.5, "loss": 17.0105, "rewards/accuracies": 0.625, "rewards/chosen": 0.016845703125, "rewards/margins": 0.7578125, "rewards/rejected": -0.7421875, "step": 226 }, { "epoch": 0.6340782122905028, "grad_norm": 288.8094177246094, "learning_rate": 7.318435754189943e-07, "logits/chosen": -0.49609375, "logits/rejected": -0.484375, "logps/chosen": -89.0, "logps/rejected": -92.0, "loss": 15.95, "rewards/accuracies": 0.6875, "rewards/chosen": -0.29296875, "rewards/margins": 0.640625, "rewards/rejected": -0.93359375, "step": 227 }, { "epoch": 0.6368715083798883, "grad_norm": 352.318115234375, "learning_rate": 7.262569832402235e-07, "logits/chosen": -0.396484375, "logits/rejected": -0.408203125, "logps/chosen": -97.0, "logps/rejected": -110.0, "loss": 20.4772, "rewards/accuracies": 0.625, "rewards/chosen": -0.365234375, "rewards/margins": 0.490234375, "rewards/rejected": -0.85546875, "step": 228 }, { "epoch": 0.6396648044692738, "grad_norm": 285.5461730957031, "learning_rate": 7.206703910614524e-07, "logits/chosen": -0.484375, "logits/rejected": -0.47265625, "logps/chosen": -102.0, "logps/rejected": -123.5, "loss": 13.2544, "rewards/accuracies": 0.84375, "rewards/chosen": -0.26171875, "rewards/margins": 1.0078125, "rewards/rejected": -1.2734375, "step": 229 }, { "epoch": 0.6424581005586593, "grad_norm": 334.38385009765625, "learning_rate": 7.150837988826815e-07, "logits/chosen": -0.462890625, "logits/rejected": -0.431640625, "logps/chosen": -105.0, "logps/rejected": -104.5, "loss": 15.3372, "rewards/accuracies": 0.75, "rewards/chosen": -0.1015625, "rewards/margins": 0.87109375, "rewards/rejected": -0.97265625, "step": 230 }, { "epoch": 0.6452513966480447, "grad_norm": 311.9142761230469, "learning_rate": 7.094972067039106e-07, "logits/chosen": -0.435546875, "logits/rejected": -0.4375, "logps/chosen": -89.0, "logps/rejected": -135.0, "loss": 15.5798, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0137939453125, "rewards/margins": 0.9765625, "rewards/rejected": -0.96484375, "step": 231 }, { "epoch": 0.6480446927374302, "grad_norm": 332.73565673828125, "learning_rate": 7.039106145251397e-07, "logits/chosen": -0.408203125, "logits/rejected": -0.458984375, "logps/chosen": -95.0, "logps/rejected": -104.0, "loss": 15.9346, "rewards/accuracies": 0.75, "rewards/chosen": -0.158203125, "rewards/margins": 0.88671875, "rewards/rejected": -1.046875, "step": 232 }, { "epoch": 0.6508379888268156, "grad_norm": 302.29547119140625, "learning_rate": 6.983240223463687e-07, "logits/chosen": -0.408203125, "logits/rejected": -0.443359375, "logps/chosen": -88.0, "logps/rejected": -96.0, "loss": 14.2324, "rewards/accuracies": 0.84375, "rewards/chosen": -0.2421875, "rewards/margins": 0.81640625, "rewards/rejected": -1.0625, "step": 233 }, { "epoch": 0.6536312849162011, "grad_norm": 277.68182373046875, "learning_rate": 6.927374301675977e-07, "logits/chosen": -0.443359375, "logits/rejected": -0.439453125, "logps/chosen": -93.5, "logps/rejected": -110.0, "loss": 13.7275, "rewards/accuracies": 0.8125, "rewards/chosen": -0.1767578125, "rewards/margins": 0.88671875, "rewards/rejected": -1.0625, "step": 234 }, { "epoch": 0.6564245810055865, "grad_norm": 382.15618896484375, "learning_rate": 6.871508379888268e-07, "logits/chosen": -0.404296875, "logits/rejected": -0.392578125, "logps/chosen": -120.5, "logps/rejected": -95.5, "loss": 14.6558, "rewards/accuracies": 0.75, "rewards/chosen": -0.201171875, "rewards/margins": 0.9140625, "rewards/rejected": -1.1171875, "step": 235 }, { "epoch": 0.659217877094972, "grad_norm": 305.14483642578125, "learning_rate": 6.815642458100558e-07, "logits/chosen": -0.408203125, "logits/rejected": -0.45703125, "logps/chosen": -127.0, "logps/rejected": -109.0, "loss": 11.4548, "rewards/accuracies": 0.84375, "rewards/chosen": -0.0184326171875, "rewards/margins": 1.296875, "rewards/rejected": -1.3125, "step": 236 }, { "epoch": 0.6620111731843575, "grad_norm": 358.1734924316406, "learning_rate": 6.759776536312849e-07, "logits/chosen": -0.50390625, "logits/rejected": -0.44921875, "logps/chosen": -98.0, "logps/rejected": -109.0, "loss": 16.2909, "rewards/accuracies": 0.75, "rewards/chosen": -0.298828125, "rewards/margins": 0.76953125, "rewards/rejected": -1.0703125, "step": 237 }, { "epoch": 0.664804469273743, "grad_norm": 326.9573974609375, "learning_rate": 6.703910614525138e-07, "logits/chosen": -0.40625, "logits/rejected": -0.4296875, "logps/chosen": -101.0, "logps/rejected": -97.5, "loss": 15.6274, "rewards/accuracies": 0.78125, "rewards/chosen": 0.04638671875, "rewards/margins": 0.91796875, "rewards/rejected": -0.87109375, "step": 238 }, { "epoch": 0.6675977653631285, "grad_norm": 285.2895812988281, "learning_rate": 6.64804469273743e-07, "logits/chosen": -0.408203125, "logits/rejected": -0.462890625, "logps/chosen": -79.0, "logps/rejected": -92.0, "loss": 15.4426, "rewards/accuracies": 0.75, "rewards/chosen": 0.08984375, "rewards/margins": 0.81640625, "rewards/rejected": -0.7265625, "step": 239 }, { "epoch": 0.6703910614525139, "grad_norm": 394.8211364746094, "learning_rate": 6.59217877094972e-07, "logits/chosen": -0.43359375, "logits/rejected": -0.4453125, "logps/chosen": -112.5, "logps/rejected": -106.0, "loss": 15.5806, "rewards/accuracies": 0.75, "rewards/chosen": -0.185546875, "rewards/margins": 0.84375, "rewards/rejected": -1.03125, "step": 240 }, { "epoch": 0.6731843575418994, "grad_norm": 400.2605285644531, "learning_rate": 6.536312849162011e-07, "logits/chosen": -0.4453125, "logits/rejected": -0.421875, "logps/chosen": -103.5, "logps/rejected": -115.5, "loss": 18.2927, "rewards/accuracies": 0.6875, "rewards/chosen": -0.3046875, "rewards/margins": 0.79296875, "rewards/rejected": -1.1015625, "step": 241 }, { "epoch": 0.6759776536312849, "grad_norm": 342.7286682128906, "learning_rate": 6.480446927374302e-07, "logits/chosen": -0.44140625, "logits/rejected": -0.4296875, "logps/chosen": -95.0, "logps/rejected": -126.0, "loss": 12.0947, "rewards/accuracies": 0.875, "rewards/chosen": -0.1611328125, "rewards/margins": 1.09375, "rewards/rejected": -1.2578125, "step": 242 }, { "epoch": 0.6787709497206704, "grad_norm": 235.05137634277344, "learning_rate": 6.424581005586592e-07, "logits/chosen": -0.4609375, "logits/rejected": -0.474609375, "logps/chosen": -86.5, "logps/rejected": -110.0, "loss": 13.6006, "rewards/accuracies": 0.75, "rewards/chosen": -0.0673828125, "rewards/margins": 1.125, "rewards/rejected": -1.1875, "step": 243 }, { "epoch": 0.6815642458100558, "grad_norm": 332.14874267578125, "learning_rate": 6.368715083798882e-07, "logits/chosen": -0.431640625, "logits/rejected": -0.427734375, "logps/chosen": -89.0, "logps/rejected": -107.0, "loss": 18.3809, "rewards/accuracies": 0.6875, "rewards/chosen": -0.322265625, "rewards/margins": 0.486328125, "rewards/rejected": -0.80859375, "step": 244 }, { "epoch": 0.6843575418994413, "grad_norm": 351.1087646484375, "learning_rate": 6.312849162011172e-07, "logits/chosen": -0.447265625, "logits/rejected": -0.41015625, "logps/chosen": -91.0, "logps/rejected": -112.0, "loss": 16.8005, "rewards/accuracies": 0.75, "rewards/chosen": -0.474609375, "rewards/margins": 0.66796875, "rewards/rejected": -1.140625, "step": 245 }, { "epoch": 0.6871508379888268, "grad_norm": 367.9377746582031, "learning_rate": 6.256983240223464e-07, "logits/chosen": -0.44921875, "logits/rejected": -0.470703125, "logps/chosen": -107.0, "logps/rejected": -100.0, "loss": 16.3018, "rewards/accuracies": 0.78125, "rewards/chosen": -0.24609375, "rewards/margins": 0.71875, "rewards/rejected": -0.96484375, "step": 246 }, { "epoch": 0.6899441340782123, "grad_norm": 305.1735534667969, "learning_rate": 6.201117318435754e-07, "logits/chosen": -0.486328125, "logits/rejected": -0.48828125, "logps/chosen": -82.5, "logps/rejected": -109.5, "loss": 15.9133, "rewards/accuracies": 0.6875, "rewards/chosen": -0.166015625, "rewards/margins": 0.828125, "rewards/rejected": -0.9921875, "step": 247 }, { "epoch": 0.6927374301675978, "grad_norm": 318.4250793457031, "learning_rate": 6.145251396648044e-07, "logits/chosen": -0.42578125, "logits/rejected": -0.46484375, "logps/chosen": -103.5, "logps/rejected": -125.5, "loss": 14.896, "rewards/accuracies": 0.71875, "rewards/chosen": -0.21484375, "rewards/margins": 0.79296875, "rewards/rejected": -1.0078125, "step": 248 }, { "epoch": 0.6955307262569832, "grad_norm": 341.1872863769531, "learning_rate": 6.089385474860335e-07, "logits/chosen": -0.53125, "logits/rejected": -0.474609375, "logps/chosen": -84.0, "logps/rejected": -91.5, "loss": 16.0985, "rewards/accuracies": 0.75, "rewards/chosen": -0.06103515625, "rewards/margins": 0.7578125, "rewards/rejected": -0.8203125, "step": 249 }, { "epoch": 0.6983240223463687, "grad_norm": 343.12841796875, "learning_rate": 6.033519553072626e-07, "logits/chosen": -0.427734375, "logits/rejected": -0.435546875, "logps/chosen": -108.0, "logps/rejected": -120.5, "loss": 16.7743, "rewards/accuracies": 0.59375, "rewards/chosen": -0.054443359375, "rewards/margins": 0.75390625, "rewards/rejected": -0.80859375, "step": 250 }, { "epoch": 0.7011173184357542, "grad_norm": 325.6700439453125, "learning_rate": 5.977653631284916e-07, "logits/chosen": -0.48046875, "logits/rejected": -0.416015625, "logps/chosen": -95.5, "logps/rejected": -129.0, "loss": 12.6045, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0072021484375, "rewards/margins": 1.2578125, "rewards/rejected": -1.265625, "step": 251 }, { "epoch": 0.7039106145251397, "grad_norm": 406.1873779296875, "learning_rate": 5.921787709497206e-07, "logits/chosen": -0.458984375, "logits/rejected": -0.44921875, "logps/chosen": -98.5, "logps/rejected": -98.0, "loss": 19.8008, "rewards/accuracies": 0.53125, "rewards/chosen": -0.1767578125, "rewards/margins": 0.58203125, "rewards/rejected": -0.7578125, "step": 252 }, { "epoch": 0.7067039106145251, "grad_norm": 436.3978576660156, "learning_rate": 5.865921787709497e-07, "logits/chosen": -0.478515625, "logits/rejected": -0.478515625, "logps/chosen": -105.0, "logps/rejected": -95.0, "loss": 16.3298, "rewards/accuracies": 0.78125, "rewards/chosen": -0.2001953125, "rewards/margins": 0.7421875, "rewards/rejected": -0.94140625, "step": 253 }, { "epoch": 0.7094972067039106, "grad_norm": 375.7546691894531, "learning_rate": 5.810055865921788e-07, "logits/chosen": -0.390625, "logits/rejected": -0.4609375, "logps/chosen": -111.0, "logps/rejected": -115.5, "loss": 14.7023, "rewards/accuracies": 0.75, "rewards/chosen": 0.119140625, "rewards/margins": 1.1171875, "rewards/rejected": -1.0, "step": 254 }, { "epoch": 0.7122905027932961, "grad_norm": 335.0268249511719, "learning_rate": 5.754189944134078e-07, "logits/chosen": -0.44140625, "logits/rejected": -0.455078125, "logps/chosen": -83.0, "logps/rejected": -122.5, "loss": 14.2463, "rewards/accuracies": 0.71875, "rewards/chosen": -0.1318359375, "rewards/margins": 1.03125, "rewards/rejected": -1.15625, "step": 255 }, { "epoch": 0.7150837988826816, "grad_norm": 307.83355712890625, "learning_rate": 5.698324022346367e-07, "logits/chosen": -0.482421875, "logits/rejected": -0.470703125, "logps/chosen": -99.0, "logps/rejected": -99.5, "loss": 14.6943, "rewards/accuracies": 0.65625, "rewards/chosen": -0.09423828125, "rewards/margins": 0.96875, "rewards/rejected": -1.0625, "step": 256 }, { "epoch": 0.7178770949720671, "grad_norm": 303.5449523925781, "learning_rate": 5.642458100558659e-07, "logits/chosen": -0.490234375, "logits/rejected": -0.4375, "logps/chosen": -96.0, "logps/rejected": -137.0, "loss": 12.6687, "rewards/accuracies": 0.84375, "rewards/chosen": -0.166015625, "rewards/margins": 1.0625, "rewards/rejected": -1.2265625, "step": 257 }, { "epoch": 0.7206703910614525, "grad_norm": 280.46392822265625, "learning_rate": 5.586592178770949e-07, "logits/chosen": -0.474609375, "logits/rejected": -0.4921875, "logps/chosen": -84.0, "logps/rejected": -126.0, "loss": 14.1614, "rewards/accuracies": 0.8125, "rewards/chosen": -0.0703125, "rewards/margins": 0.91796875, "rewards/rejected": -0.98828125, "step": 258 }, { "epoch": 0.723463687150838, "grad_norm": 303.459716796875, "learning_rate": 5.53072625698324e-07, "logits/chosen": -0.416015625, "logits/rejected": -0.4609375, "logps/chosen": -94.5, "logps/rejected": -105.0, "loss": 14.3795, "rewards/accuracies": 0.78125, "rewards/chosen": -0.021484375, "rewards/margins": 0.90625, "rewards/rejected": -0.9296875, "step": 259 }, { "epoch": 0.7262569832402235, "grad_norm": 317.22308349609375, "learning_rate": 5.474860335195531e-07, "logits/chosen": -0.443359375, "logits/rejected": -0.4921875, "logps/chosen": -99.5, "logps/rejected": -130.0, "loss": 13.5237, "rewards/accuracies": 0.8125, "rewards/chosen": -0.12890625, "rewards/margins": 0.9453125, "rewards/rejected": -1.0703125, "step": 260 }, { "epoch": 0.729050279329609, "grad_norm": 303.67919921875, "learning_rate": 5.418994413407821e-07, "logits/chosen": -0.400390625, "logits/rejected": -0.44921875, "logps/chosen": -85.5, "logps/rejected": -90.0, "loss": 12.967, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0859375, "rewards/margins": 1.0546875, "rewards/rejected": -0.96484375, "step": 261 }, { "epoch": 0.7318435754189944, "grad_norm": 288.1000671386719, "learning_rate": 5.363128491620111e-07, "logits/chosen": -0.431640625, "logits/rejected": -0.46875, "logps/chosen": -107.5, "logps/rejected": -107.0, "loss": 13.396, "rewards/accuracies": 0.875, "rewards/chosen": 0.00567626953125, "rewards/margins": 1.078125, "rewards/rejected": -1.0703125, "step": 262 }, { "epoch": 0.7346368715083799, "grad_norm": 299.1371765136719, "learning_rate": 5.307262569832402e-07, "logits/chosen": -0.462890625, "logits/rejected": -0.51171875, "logps/chosen": -88.5, "logps/rejected": -116.5, "loss": 13.181, "rewards/accuracies": 0.8125, "rewards/chosen": -0.047607421875, "rewards/margins": 1.0, "rewards/rejected": -1.046875, "step": 263 }, { "epoch": 0.7374301675977654, "grad_norm": 326.4917297363281, "learning_rate": 5.251396648044693e-07, "logits/chosen": -0.46484375, "logits/rejected": -0.46875, "logps/chosen": -86.0, "logps/rejected": -100.5, "loss": 15.7773, "rewards/accuracies": 0.75, "rewards/chosen": -0.0908203125, "rewards/margins": 0.73046875, "rewards/rejected": -0.82421875, "step": 264 }, { "epoch": 0.7402234636871509, "grad_norm": 297.46929931640625, "learning_rate": 5.195530726256983e-07, "logits/chosen": -0.408203125, "logits/rejected": -0.453125, "logps/chosen": -87.0, "logps/rejected": -121.5, "loss": 12.3708, "rewards/accuracies": 0.8125, "rewards/chosen": 0.057861328125, "rewards/margins": 1.1875, "rewards/rejected": -1.125, "step": 265 }, { "epoch": 0.7430167597765364, "grad_norm": 392.9183654785156, "learning_rate": 5.139664804469273e-07, "logits/chosen": -0.5234375, "logits/rejected": -0.5078125, "logps/chosen": -92.5, "logps/rejected": -97.5, "loss": 17.7178, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0279541015625, "rewards/margins": 0.69140625, "rewards/rejected": -0.71875, "step": 266 }, { "epoch": 0.7458100558659218, "grad_norm": 261.7493591308594, "learning_rate": 5.083798882681564e-07, "logits/chosen": -0.51171875, "logits/rejected": -0.4765625, "logps/chosen": -98.5, "logps/rejected": -98.0, "loss": 13.6125, "rewards/accuracies": 0.8125, "rewards/chosen": -0.080078125, "rewards/margins": 0.8203125, "rewards/rejected": -0.90234375, "step": 267 }, { "epoch": 0.7486033519553073, "grad_norm": 426.52862548828125, "learning_rate": 5.027932960893855e-07, "logits/chosen": -0.408203125, "logits/rejected": -0.453125, "logps/chosen": -87.5, "logps/rejected": -107.5, "loss": 20.3689, "rewards/accuracies": 0.59375, "rewards/chosen": -0.1962890625, "rewards/margins": 0.53515625, "rewards/rejected": -0.734375, "step": 268 }, { "epoch": 0.7513966480446927, "grad_norm": 339.6871032714844, "learning_rate": 4.972067039106145e-07, "logits/chosen": -0.51953125, "logits/rejected": -0.5078125, "logps/chosen": -105.0, "logps/rejected": -114.5, "loss": 17.1901, "rewards/accuracies": 0.71875, "rewards/chosen": -0.2890625, "rewards/margins": 0.7734375, "rewards/rejected": -1.0625, "step": 269 }, { "epoch": 0.7541899441340782, "grad_norm": 370.1632995605469, "learning_rate": 4.916201117318435e-07, "logits/chosen": -0.46875, "logits/rejected": -0.443359375, "logps/chosen": -92.0, "logps/rejected": -103.0, "loss": 14.8296, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1669921875, "rewards/margins": 1.03125, "rewards/rejected": -0.86328125, "step": 270 }, { "epoch": 0.7569832402234636, "grad_norm": 382.3570251464844, "learning_rate": 4.860335195530726e-07, "logits/chosen": -0.5078125, "logits/rejected": -0.4765625, "logps/chosen": -95.5, "logps/rejected": -121.5, "loss": 15.3082, "rewards/accuracies": 0.8125, "rewards/chosen": -0.1865234375, "rewards/margins": 1.0, "rewards/rejected": -1.1875, "step": 271 }, { "epoch": 0.7597765363128491, "grad_norm": 317.9295959472656, "learning_rate": 4.804469273743016e-07, "logits/chosen": -0.46484375, "logits/rejected": -0.4765625, "logps/chosen": -86.0, "logps/rejected": -106.0, "loss": 14.1516, "rewards/accuracies": 0.78125, "rewards/chosen": -0.1875, "rewards/margins": 1.1015625, "rewards/rejected": -1.2890625, "step": 272 }, { "epoch": 0.7625698324022346, "grad_norm": 267.3369445800781, "learning_rate": 4.7486033519553073e-07, "logits/chosen": -0.439453125, "logits/rejected": -0.458984375, "logps/chosen": -97.0, "logps/rejected": -107.0, "loss": 14.8527, "rewards/accuracies": 0.71875, "rewards/chosen": -0.11767578125, "rewards/margins": 0.87890625, "rewards/rejected": -0.99609375, "step": 273 }, { "epoch": 0.7653631284916201, "grad_norm": 284.3284912109375, "learning_rate": 4.6927374301675976e-07, "logits/chosen": -0.42578125, "logits/rejected": -0.419921875, "logps/chosen": -92.5, "logps/rejected": -96.0, "loss": 13.535, "rewards/accuracies": 0.8125, "rewards/chosen": 0.006622314453125, "rewards/margins": 1.0625, "rewards/rejected": -1.0625, "step": 274 }, { "epoch": 0.7681564245810056, "grad_norm": 324.7522277832031, "learning_rate": 4.6368715083798884e-07, "logits/chosen": -0.427734375, "logits/rejected": -0.4296875, "logps/chosen": -98.0, "logps/rejected": -92.5, "loss": 15.5664, "rewards/accuracies": 0.78125, "rewards/chosen": -0.224609375, "rewards/margins": 0.73828125, "rewards/rejected": -0.9609375, "step": 275 }, { "epoch": 0.770949720670391, "grad_norm": 297.5564880371094, "learning_rate": 4.5810055865921786e-07, "logits/chosen": -0.458984375, "logits/rejected": -0.486328125, "logps/chosen": -92.0, "logps/rejected": -94.0, "loss": 15.7029, "rewards/accuracies": 0.75, "rewards/chosen": -0.052490234375, "rewards/margins": 0.74609375, "rewards/rejected": -0.80078125, "step": 276 }, { "epoch": 0.7737430167597765, "grad_norm": 324.4718933105469, "learning_rate": 4.5251396648044694e-07, "logits/chosen": -0.46875, "logits/rejected": -0.47265625, "logps/chosen": -90.5, "logps/rejected": -93.0, "loss": 15.0782, "rewards/accuracies": 0.6875, "rewards/chosen": 0.228515625, "rewards/margins": 0.86328125, "rewards/rejected": -0.6328125, "step": 277 }, { "epoch": 0.776536312849162, "grad_norm": 399.8809814453125, "learning_rate": 4.469273743016759e-07, "logits/chosen": -0.439453125, "logits/rejected": -0.455078125, "logps/chosen": -87.5, "logps/rejected": -102.0, "loss": 19.4246, "rewards/accuracies": 0.71875, "rewards/chosen": -0.154296875, "rewards/margins": 0.5625, "rewards/rejected": -0.71484375, "step": 278 }, { "epoch": 0.7793296089385475, "grad_norm": 283.7197265625, "learning_rate": 4.41340782122905e-07, "logits/chosen": -0.484375, "logits/rejected": -0.470703125, "logps/chosen": -99.5, "logps/rejected": -106.5, "loss": 13.9827, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0615234375, "rewards/margins": 0.81640625, "rewards/rejected": -0.875, "step": 279 }, { "epoch": 0.7821229050279329, "grad_norm": 465.72991943359375, "learning_rate": 4.35754189944134e-07, "logits/chosen": -0.462890625, "logits/rejected": -0.4921875, "logps/chosen": -96.5, "logps/rejected": -109.0, "loss": 18.2694, "rewards/accuracies": 0.6875, "rewards/chosen": -0.19921875, "rewards/margins": 0.72265625, "rewards/rejected": -0.921875, "step": 280 }, { "epoch": 0.7849162011173184, "grad_norm": 347.4021301269531, "learning_rate": 4.301675977653631e-07, "logits/chosen": -0.443359375, "logits/rejected": -0.48046875, "logps/chosen": -122.0, "logps/rejected": -136.0, "loss": 15.3776, "rewards/accuracies": 0.8125, "rewards/chosen": -0.201171875, "rewards/margins": 0.859375, "rewards/rejected": -1.0625, "step": 281 }, { "epoch": 0.7877094972067039, "grad_norm": 315.74066162109375, "learning_rate": 4.245810055865922e-07, "logits/chosen": -0.5234375, "logits/rejected": -0.498046875, "logps/chosen": -84.0, "logps/rejected": -131.0, "loss": 14.3635, "rewards/accuracies": 0.84375, "rewards/chosen": -0.1435546875, "rewards/margins": 0.9375, "rewards/rejected": -1.078125, "step": 282 }, { "epoch": 0.7905027932960894, "grad_norm": 444.82708740234375, "learning_rate": 4.189944134078212e-07, "logits/chosen": -0.38671875, "logits/rejected": -0.42578125, "logps/chosen": -105.0, "logps/rejected": -86.5, "loss": 17.2029, "rewards/accuracies": 0.75, "rewards/chosen": -0.2021484375, "rewards/margins": 0.6875, "rewards/rejected": -0.890625, "step": 283 }, { "epoch": 0.7932960893854749, "grad_norm": 350.78314208984375, "learning_rate": 4.134078212290503e-07, "logits/chosen": -0.48046875, "logits/rejected": -0.474609375, "logps/chosen": -90.5, "logps/rejected": -99.0, "loss": 16.5242, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0400390625, "rewards/margins": 0.88671875, "rewards/rejected": -0.9296875, "step": 284 }, { "epoch": 0.7960893854748603, "grad_norm": 289.1867370605469, "learning_rate": 4.078212290502793e-07, "logits/chosen": -0.45703125, "logits/rejected": -0.453125, "logps/chosen": -79.5, "logps/rejected": -120.0, "loss": 10.8177, "rewards/accuracies": 0.875, "rewards/chosen": 0.1953125, "rewards/margins": 1.4296875, "rewards/rejected": -1.234375, "step": 285 }, { "epoch": 0.7988826815642458, "grad_norm": 301.2606506347656, "learning_rate": 4.022346368715084e-07, "logits/chosen": -0.427734375, "logits/rejected": -0.458984375, "logps/chosen": -79.5, "logps/rejected": -98.5, "loss": 15.1819, "rewards/accuracies": 0.71875, "rewards/chosen": 0.10546875, "rewards/margins": 0.90625, "rewards/rejected": -0.80078125, "step": 286 }, { "epoch": 0.8016759776536313, "grad_norm": 288.2234802246094, "learning_rate": 3.966480446927374e-07, "logits/chosen": -0.45703125, "logits/rejected": -0.451171875, "logps/chosen": -89.0, "logps/rejected": -102.5, "loss": 13.6882, "rewards/accuracies": 0.75, "rewards/chosen": 0.0830078125, "rewards/margins": 1.2265625, "rewards/rejected": -1.1484375, "step": 287 }, { "epoch": 0.8044692737430168, "grad_norm": 318.3516540527344, "learning_rate": 3.9106145251396645e-07, "logits/chosen": -0.4453125, "logits/rejected": -0.451171875, "logps/chosen": -91.0, "logps/rejected": -106.5, "loss": 15.4403, "rewards/accuracies": 0.75, "rewards/chosen": 0.12158203125, "rewards/margins": 0.80859375, "rewards/rejected": -0.6875, "step": 288 }, { "epoch": 0.8072625698324022, "grad_norm": 287.2728576660156, "learning_rate": 3.8547486033519547e-07, "logits/chosen": -0.490234375, "logits/rejected": -0.494140625, "logps/chosen": -96.5, "logps/rejected": -109.0, "loss": 13.8624, "rewards/accuracies": 0.84375, "rewards/chosen": -0.169921875, "rewards/margins": 0.88671875, "rewards/rejected": -1.0546875, "step": 289 }, { "epoch": 0.8100558659217877, "grad_norm": 264.20953369140625, "learning_rate": 3.7988826815642455e-07, "logits/chosen": -0.4765625, "logits/rejected": -0.4609375, "logps/chosen": -92.0, "logps/rejected": -111.5, "loss": 11.7361, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3515625, "rewards/margins": 1.3046875, "rewards/rejected": -0.953125, "step": 290 }, { "epoch": 0.8128491620111732, "grad_norm": 345.477783203125, "learning_rate": 3.7430167597765363e-07, "logits/chosen": -0.42578125, "logits/rejected": -0.427734375, "logps/chosen": -84.5, "logps/rejected": -103.5, "loss": 18.3667, "rewards/accuracies": 0.65625, "rewards/chosen": 0.06884765625, "rewards/margins": 0.67578125, "rewards/rejected": -0.60546875, "step": 291 }, { "epoch": 0.8156424581005587, "grad_norm": 324.28680419921875, "learning_rate": 3.6871508379888266e-07, "logits/chosen": -0.49609375, "logits/rejected": -0.46875, "logps/chosen": -84.5, "logps/rejected": -89.5, "loss": 16.6636, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1767578125, "rewards/margins": 0.57421875, "rewards/rejected": -0.396484375, "step": 292 }, { "epoch": 0.8184357541899442, "grad_norm": 295.9873046875, "learning_rate": 3.6312849162011174e-07, "logits/chosen": -0.4609375, "logits/rejected": -0.46875, "logps/chosen": -91.5, "logps/rejected": -105.0, "loss": 14.2749, "rewards/accuracies": 0.8125, "rewards/chosen": 0.083984375, "rewards/margins": 0.9375, "rewards/rejected": -0.8515625, "step": 293 }, { "epoch": 0.8212290502793296, "grad_norm": 321.2386779785156, "learning_rate": 3.5754189944134076e-07, "logits/chosen": -0.5078125, "logits/rejected": -0.470703125, "logps/chosen": -94.0, "logps/rejected": -130.0, "loss": 11.908, "rewards/accuracies": 0.75, "rewards/chosen": 0.099609375, "rewards/margins": 1.3359375, "rewards/rejected": -1.234375, "step": 294 }, { "epoch": 0.8240223463687151, "grad_norm": 363.22576904296875, "learning_rate": 3.5195530726256984e-07, "logits/chosen": -0.45703125, "logits/rejected": -0.458984375, "logps/chosen": -80.0, "logps/rejected": -113.5, "loss": 15.7787, "rewards/accuracies": 0.625, "rewards/chosen": 0.2119140625, "rewards/margins": 0.92578125, "rewards/rejected": -0.71484375, "step": 295 }, { "epoch": 0.8268156424581006, "grad_norm": 403.50311279296875, "learning_rate": 3.4636871508379887e-07, "logits/chosen": -0.4921875, "logits/rejected": -0.453125, "logps/chosen": -96.5, "logps/rejected": -115.5, "loss": 16.0835, "rewards/accuracies": 0.71875, "rewards/chosen": -0.050048828125, "rewards/margins": 0.91015625, "rewards/rejected": -0.9609375, "step": 296 }, { "epoch": 0.8296089385474861, "grad_norm": 380.5469665527344, "learning_rate": 3.407821229050279e-07, "logits/chosen": -0.474609375, "logits/rejected": -0.474609375, "logps/chosen": -83.0, "logps/rejected": -113.0, "loss": 18.3544, "rewards/accuracies": 0.625, "rewards/chosen": -0.0159912109375, "rewards/margins": 0.69921875, "rewards/rejected": -0.71484375, "step": 297 }, { "epoch": 0.8324022346368715, "grad_norm": 454.0310363769531, "learning_rate": 3.351955307262569e-07, "logits/chosen": -0.498046875, "logits/rejected": -0.490234375, "logps/chosen": -93.0, "logps/rejected": -112.0, "loss": 15.6326, "rewards/accuracies": 0.8125, "rewards/chosen": -0.12060546875, "rewards/margins": 0.890625, "rewards/rejected": -1.015625, "step": 298 }, { "epoch": 0.835195530726257, "grad_norm": 357.63946533203125, "learning_rate": 3.29608938547486e-07, "logits/chosen": -0.404296875, "logits/rejected": -0.439453125, "logps/chosen": -89.5, "logps/rejected": -114.0, "loss": 17.6284, "rewards/accuracies": 0.78125, "rewards/chosen": -0.10546875, "rewards/margins": 0.6015625, "rewards/rejected": -0.70703125, "step": 299 }, { "epoch": 0.8379888268156425, "grad_norm": 254.75082397460938, "learning_rate": 3.240223463687151e-07, "logits/chosen": -0.53515625, "logits/rejected": -0.5, "logps/chosen": -83.0, "logps/rejected": -101.0, "loss": 14.0181, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0289306640625, "rewards/margins": 1.0078125, "rewards/rejected": -0.98046875, "step": 300 }, { "epoch": 0.840782122905028, "grad_norm": 349.7223815917969, "learning_rate": 3.184357541899441e-07, "logits/chosen": -0.47265625, "logits/rejected": -0.490234375, "logps/chosen": -74.0, "logps/rejected": -104.0, "loss": 16.0482, "rewards/accuracies": 0.8125, "rewards/chosen": 0.078125, "rewards/margins": 0.82421875, "rewards/rejected": -0.74609375, "step": 301 }, { "epoch": 0.8435754189944135, "grad_norm": 308.7284240722656, "learning_rate": 3.128491620111732e-07, "logits/chosen": -0.51171875, "logits/rejected": -0.474609375, "logps/chosen": -103.0, "logps/rejected": -112.5, "loss": 10.5377, "rewards/accuracies": 0.90625, "rewards/chosen": 0.205078125, "rewards/margins": 1.4296875, "rewards/rejected": -1.2265625, "step": 302 }, { "epoch": 0.8463687150837989, "grad_norm": 319.7746276855469, "learning_rate": 3.072625698324022e-07, "logits/chosen": -0.4296875, "logits/rejected": -0.435546875, "logps/chosen": -85.5, "logps/rejected": -108.5, "loss": 15.1665, "rewards/accuracies": 0.6875, "rewards/chosen": -0.07861328125, "rewards/margins": 0.9765625, "rewards/rejected": -1.0546875, "step": 303 }, { "epoch": 0.8491620111731844, "grad_norm": 270.3304443359375, "learning_rate": 3.016759776536313e-07, "logits/chosen": -0.439453125, "logits/rejected": -0.435546875, "logps/chosen": -85.0, "logps/rejected": -98.5, "loss": 11.3719, "rewards/accuracies": 0.90625, "rewards/chosen": 0.09912109375, "rewards/margins": 1.2890625, "rewards/rejected": -1.1875, "step": 304 }, { "epoch": 0.8519553072625698, "grad_norm": 294.9878845214844, "learning_rate": 2.960893854748603e-07, "logits/chosen": -0.47265625, "logits/rejected": -0.466796875, "logps/chosen": -93.0, "logps/rejected": -106.5, "loss": 13.5219, "rewards/accuracies": 0.90625, "rewards/chosen": 0.11328125, "rewards/margins": 1.15625, "rewards/rejected": -1.046875, "step": 305 }, { "epoch": 0.8547486033519553, "grad_norm": 393.5072326660156, "learning_rate": 2.905027932960894e-07, "logits/chosen": -0.46875, "logits/rejected": -0.5078125, "logps/chosen": -84.0, "logps/rejected": -135.0, "loss": 16.3635, "rewards/accuracies": 0.6875, "rewards/chosen": -0.07373046875, "rewards/margins": 0.921875, "rewards/rejected": -0.99609375, "step": 306 }, { "epoch": 0.8575418994413407, "grad_norm": 566.7234497070312, "learning_rate": 2.849162011173184e-07, "logits/chosen": -0.453125, "logits/rejected": -0.451171875, "logps/chosen": -108.5, "logps/rejected": -130.0, "loss": 12.1479, "rewards/accuracies": 0.84375, "rewards/chosen": 0.146484375, "rewards/margins": 1.21875, "rewards/rejected": -1.0703125, "step": 307 }, { "epoch": 0.8603351955307262, "grad_norm": 488.4166564941406, "learning_rate": 2.7932960893854745e-07, "logits/chosen": -0.44140625, "logits/rejected": -0.4609375, "logps/chosen": -96.0, "logps/rejected": -100.5, "loss": 15.8679, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0147705078125, "rewards/margins": 0.78125, "rewards/rejected": -0.796875, "step": 308 }, { "epoch": 0.8631284916201117, "grad_norm": 387.6913146972656, "learning_rate": 2.7374301675977653e-07, "logits/chosen": -0.44140625, "logits/rejected": -0.490234375, "logps/chosen": -70.5, "logps/rejected": -107.0, "loss": 15.6094, "rewards/accuracies": 0.8125, "rewards/chosen": -0.11474609375, "rewards/margins": 0.7890625, "rewards/rejected": -0.90625, "step": 309 }, { "epoch": 0.8659217877094972, "grad_norm": 241.2503204345703, "learning_rate": 2.6815642458100556e-07, "logits/chosen": -0.427734375, "logits/rejected": -0.42578125, "logps/chosen": -85.0, "logps/rejected": -95.5, "loss": 10.3677, "rewards/accuracies": 0.875, "rewards/chosen": 0.40234375, "rewards/margins": 1.453125, "rewards/rejected": -1.046875, "step": 310 }, { "epoch": 0.8687150837988827, "grad_norm": 330.4330139160156, "learning_rate": 2.6256983240223464e-07, "logits/chosen": -0.48828125, "logits/rejected": -0.4921875, "logps/chosen": -84.0, "logps/rejected": -109.5, "loss": 12.0811, "rewards/accuracies": 0.875, "rewards/chosen": 0.287109375, "rewards/margins": 1.203125, "rewards/rejected": -0.91796875, "step": 311 }, { "epoch": 0.8715083798882681, "grad_norm": 286.39117431640625, "learning_rate": 2.5698324022346367e-07, "logits/chosen": -0.498046875, "logits/rejected": -0.4765625, "logps/chosen": -97.0, "logps/rejected": -118.0, "loss": 12.5333, "rewards/accuracies": 0.84375, "rewards/chosen": -0.031494140625, "rewards/margins": 1.0625, "rewards/rejected": -1.09375, "step": 312 }, { "epoch": 0.8743016759776536, "grad_norm": 369.7723083496094, "learning_rate": 2.5139664804469275e-07, "logits/chosen": -0.4609375, "logits/rejected": -0.498046875, "logps/chosen": -92.5, "logps/rejected": -85.0, "loss": 17.667, "rewards/accuracies": 0.75, "rewards/chosen": -0.1279296875, "rewards/margins": 0.6171875, "rewards/rejected": -0.74609375, "step": 313 }, { "epoch": 0.8770949720670391, "grad_norm": 348.3324890136719, "learning_rate": 2.4581005586592177e-07, "logits/chosen": -0.466796875, "logits/rejected": -0.46484375, "logps/chosen": -106.5, "logps/rejected": -94.0, "loss": 15.1628, "rewards/accuracies": 0.75, "rewards/chosen": 0.1787109375, "rewards/margins": 0.84375, "rewards/rejected": -0.6640625, "step": 314 }, { "epoch": 0.8798882681564246, "grad_norm": 349.54266357421875, "learning_rate": 2.402234636871508e-07, "logits/chosen": -0.474609375, "logits/rejected": -0.50390625, "logps/chosen": -82.5, "logps/rejected": -99.5, "loss": 15.8306, "rewards/accuracies": 0.75, "rewards/chosen": 0.0341796875, "rewards/margins": 0.796875, "rewards/rejected": -0.76171875, "step": 315 }, { "epoch": 0.88268156424581, "grad_norm": 272.3092041015625, "learning_rate": 2.3463687150837988e-07, "logits/chosen": -0.462890625, "logits/rejected": -0.45703125, "logps/chosen": -80.5, "logps/rejected": -106.5, "loss": 13.5332, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1533203125, "rewards/margins": 0.98828125, "rewards/rejected": -0.8359375, "step": 316 }, { "epoch": 0.8854748603351955, "grad_norm": 300.5837707519531, "learning_rate": 2.2905027932960893e-07, "logits/chosen": -0.53125, "logits/rejected": -0.51953125, "logps/chosen": -85.0, "logps/rejected": -93.0, "loss": 15.1248, "rewards/accuracies": 0.875, "rewards/chosen": 0.015625, "rewards/margins": 0.96484375, "rewards/rejected": -0.94921875, "step": 317 }, { "epoch": 0.888268156424581, "grad_norm": 329.7796936035156, "learning_rate": 2.2346368715083796e-07, "logits/chosen": -0.53125, "logits/rejected": -0.470703125, "logps/chosen": -104.0, "logps/rejected": -110.5, "loss": 16.1404, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0927734375, "rewards/margins": 0.89453125, "rewards/rejected": -0.98828125, "step": 318 }, { "epoch": 0.8910614525139665, "grad_norm": 354.9517822265625, "learning_rate": 2.17877094972067e-07, "logits/chosen": -0.51953125, "logits/rejected": -0.490234375, "logps/chosen": -102.0, "logps/rejected": -97.5, "loss": 15.4823, "rewards/accuracies": 0.78125, "rewards/chosen": 0.08154296875, "rewards/margins": 0.7890625, "rewards/rejected": -0.7109375, "step": 319 }, { "epoch": 0.8938547486033519, "grad_norm": 329.7102966308594, "learning_rate": 2.122905027932961e-07, "logits/chosen": -0.515625, "logits/rejected": -0.498046875, "logps/chosen": -90.0, "logps/rejected": -106.0, "loss": 14.5303, "rewards/accuracies": 0.6875, "rewards/chosen": -0.02734375, "rewards/margins": 1.0859375, "rewards/rejected": -1.1171875, "step": 320 }, { "epoch": 0.8966480446927374, "grad_norm": 387.6121520996094, "learning_rate": 2.0670391061452514e-07, "logits/chosen": -0.486328125, "logits/rejected": -0.51171875, "logps/chosen": -89.0, "logps/rejected": -102.5, "loss": 17.7892, "rewards/accuracies": 0.75, "rewards/chosen": 0.228515625, "rewards/margins": 0.64453125, "rewards/rejected": -0.41796875, "step": 321 }, { "epoch": 0.8994413407821229, "grad_norm": 320.6269226074219, "learning_rate": 2.011173184357542e-07, "logits/chosen": -0.5234375, "logits/rejected": -0.4765625, "logps/chosen": -94.5, "logps/rejected": -107.5, "loss": 16.0719, "rewards/accuracies": 0.75, "rewards/chosen": -0.0281982421875, "rewards/margins": 0.78515625, "rewards/rejected": -0.8125, "step": 322 }, { "epoch": 0.9022346368715084, "grad_norm": 349.1639404296875, "learning_rate": 1.9553072625698322e-07, "logits/chosen": -0.498046875, "logits/rejected": -0.494140625, "logps/chosen": -95.5, "logps/rejected": -107.5, "loss": 14.4479, "rewards/accuracies": 0.84375, "rewards/chosen": 0.048095703125, "rewards/margins": 0.94921875, "rewards/rejected": -0.90234375, "step": 323 }, { "epoch": 0.9050279329608939, "grad_norm": 454.15234375, "learning_rate": 1.8994413407821228e-07, "logits/chosen": -0.470703125, "logits/rejected": -0.431640625, "logps/chosen": -89.0, "logps/rejected": -113.5, "loss": 17.6936, "rewards/accuracies": 0.6875, "rewards/chosen": -0.130859375, "rewards/margins": 0.57421875, "rewards/rejected": -0.70703125, "step": 324 }, { "epoch": 0.9078212290502793, "grad_norm": 314.83587646484375, "learning_rate": 1.8435754189944133e-07, "logits/chosen": -0.447265625, "logits/rejected": -0.443359375, "logps/chosen": -120.0, "logps/rejected": -108.5, "loss": 13.2095, "rewards/accuracies": 0.75, "rewards/chosen": -0.169921875, "rewards/margins": 1.046875, "rewards/rejected": -1.21875, "step": 325 }, { "epoch": 0.9106145251396648, "grad_norm": 298.6294860839844, "learning_rate": 1.7877094972067038e-07, "logits/chosen": -0.455078125, "logits/rejected": -0.4765625, "logps/chosen": -85.5, "logps/rejected": -101.5, "loss": 14.9586, "rewards/accuracies": 0.8125, "rewards/chosen": -0.0233154296875, "rewards/margins": 0.79296875, "rewards/rejected": -0.81640625, "step": 326 }, { "epoch": 0.9134078212290503, "grad_norm": 286.4591064453125, "learning_rate": 1.7318435754189943e-07, "logits/chosen": -0.54296875, "logits/rejected": -0.474609375, "logps/chosen": -77.5, "logps/rejected": -91.5, "loss": 13.7004, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0291748046875, "rewards/margins": 0.92578125, "rewards/rejected": -0.8984375, "step": 327 }, { "epoch": 0.9162011173184358, "grad_norm": 340.45379638671875, "learning_rate": 1.6759776536312846e-07, "logits/chosen": -0.4609375, "logits/rejected": -0.482421875, "logps/chosen": -104.5, "logps/rejected": -117.0, "loss": 12.6042, "rewards/accuracies": 0.78125, "rewards/chosen": 0.197265625, "rewards/margins": 1.15625, "rewards/rejected": -0.96484375, "step": 328 }, { "epoch": 0.9189944134078212, "grad_norm": 360.7672119140625, "learning_rate": 1.6201117318435754e-07, "logits/chosen": -0.515625, "logits/rejected": -0.5234375, "logps/chosen": -101.0, "logps/rejected": -91.5, "loss": 15.7744, "rewards/accuracies": 0.75, "rewards/chosen": -0.03515625, "rewards/margins": 0.75390625, "rewards/rejected": -0.7890625, "step": 329 }, { "epoch": 0.9217877094972067, "grad_norm": 342.765869140625, "learning_rate": 1.564245810055866e-07, "logits/chosen": -0.466796875, "logits/rejected": -0.400390625, "logps/chosen": -79.5, "logps/rejected": -102.0, "loss": 11.5359, "rewards/accuracies": 0.8125, "rewards/chosen": 0.185546875, "rewards/margins": 1.265625, "rewards/rejected": -1.078125, "step": 330 }, { "epoch": 0.9245810055865922, "grad_norm": 316.0368957519531, "learning_rate": 1.5083798882681565e-07, "logits/chosen": -0.4609375, "logits/rejected": -0.490234375, "logps/chosen": -76.5, "logps/rejected": -111.0, "loss": 14.4135, "rewards/accuracies": 0.75, "rewards/chosen": 0.0810546875, "rewards/margins": 0.98828125, "rewards/rejected": -0.90625, "step": 331 }, { "epoch": 0.9273743016759777, "grad_norm": 424.5470886230469, "learning_rate": 1.452513966480447e-07, "logits/chosen": -0.5078125, "logits/rejected": -0.5390625, "logps/chosen": -109.5, "logps/rejected": -113.0, "loss": 19.2145, "rewards/accuracies": 0.71875, "rewards/chosen": 0.052490234375, "rewards/margins": 0.83984375, "rewards/rejected": -0.7890625, "step": 332 }, { "epoch": 0.9301675977653632, "grad_norm": 361.7523498535156, "learning_rate": 1.3966480446927373e-07, "logits/chosen": -0.4921875, "logits/rejected": -0.48828125, "logps/chosen": -90.5, "logps/rejected": -91.5, "loss": 16.457, "rewards/accuracies": 0.8125, "rewards/chosen": -0.1875, "rewards/margins": 0.62109375, "rewards/rejected": -0.80859375, "step": 333 }, { "epoch": 0.9329608938547486, "grad_norm": 319.6543273925781, "learning_rate": 1.3407821229050278e-07, "logits/chosen": -0.462890625, "logits/rejected": -0.48828125, "logps/chosen": -94.0, "logps/rejected": -93.0, "loss": 15.2075, "rewards/accuracies": 0.8125, "rewards/chosen": -0.140625, "rewards/margins": 0.67578125, "rewards/rejected": -0.81640625, "step": 334 }, { "epoch": 0.9357541899441341, "grad_norm": 263.7701110839844, "learning_rate": 1.2849162011173183e-07, "logits/chosen": -0.458984375, "logits/rejected": -0.4765625, "logps/chosen": -92.5, "logps/rejected": -114.0, "loss": 11.5092, "rewards/accuracies": 0.8125, "rewards/chosen": 0.478515625, "rewards/margins": 1.296875, "rewards/rejected": -0.81640625, "step": 335 }, { "epoch": 0.9385474860335196, "grad_norm": 334.8875427246094, "learning_rate": 1.2290502793296089e-07, "logits/chosen": -0.47265625, "logits/rejected": -0.439453125, "logps/chosen": -97.0, "logps/rejected": -109.5, "loss": 13.4487, "rewards/accuracies": 0.71875, "rewards/chosen": 0.28515625, "rewards/margins": 1.171875, "rewards/rejected": -0.88671875, "step": 336 }, { "epoch": 0.9413407821229051, "grad_norm": 377.3766784667969, "learning_rate": 1.1731843575418994e-07, "logits/chosen": -0.46875, "logits/rejected": -0.466796875, "logps/chosen": -87.5, "logps/rejected": -100.5, "loss": 17.8179, "rewards/accuracies": 0.71875, "rewards/chosen": -0.2001953125, "rewards/margins": 0.498046875, "rewards/rejected": -0.69921875, "step": 337 }, { "epoch": 0.9441340782122905, "grad_norm": 354.2020263671875, "learning_rate": 1.1173184357541898e-07, "logits/chosen": -0.419921875, "logits/rejected": -0.466796875, "logps/chosen": -111.5, "logps/rejected": -97.0, "loss": 15.1058, "rewards/accuracies": 0.71875, "rewards/chosen": 0.07177734375, "rewards/margins": 0.96875, "rewards/rejected": -0.89453125, "step": 338 }, { "epoch": 0.946927374301676, "grad_norm": 341.46759033203125, "learning_rate": 1.0614525139664805e-07, "logits/chosen": -0.474609375, "logits/rejected": -0.494140625, "logps/chosen": -96.5, "logps/rejected": -94.5, "loss": 16.9966, "rewards/accuracies": 0.75, "rewards/chosen": 0.07958984375, "rewards/margins": 0.7109375, "rewards/rejected": -0.62890625, "step": 339 }, { "epoch": 0.9497206703910615, "grad_norm": 331.21722412109375, "learning_rate": 1.005586592178771e-07, "logits/chosen": -0.453125, "logits/rejected": -0.48046875, "logps/chosen": -92.5, "logps/rejected": -92.5, "loss": 14.3752, "rewards/accuracies": 0.84375, "rewards/chosen": -0.0205078125, "rewards/margins": 0.984375, "rewards/rejected": -1.0078125, "step": 340 }, { "epoch": 0.952513966480447, "grad_norm": 330.5957946777344, "learning_rate": 9.497206703910614e-08, "logits/chosen": -0.421875, "logits/rejected": -0.453125, "logps/chosen": -95.0, "logps/rejected": -88.5, "loss": 14.0923, "rewards/accuracies": 0.71875, "rewards/chosen": 0.212890625, "rewards/margins": 1.078125, "rewards/rejected": -0.86328125, "step": 341 }, { "epoch": 0.9553072625698324, "grad_norm": 377.267822265625, "learning_rate": 8.938547486033519e-08, "logits/chosen": -0.48046875, "logits/rejected": -0.53125, "logps/chosen": -105.0, "logps/rejected": -126.5, "loss": 17.0643, "rewards/accuracies": 0.65625, "rewards/chosen": -0.298828125, "rewards/margins": 0.73046875, "rewards/rejected": -1.03125, "step": 342 }, { "epoch": 0.9581005586592178, "grad_norm": 300.7218322753906, "learning_rate": 8.379888268156423e-08, "logits/chosen": -0.466796875, "logits/rejected": -0.427734375, "logps/chosen": -85.5, "logps/rejected": -109.5, "loss": 12.0635, "rewards/accuracies": 0.875, "rewards/chosen": 0.265625, "rewards/margins": 1.078125, "rewards/rejected": -0.80859375, "step": 343 }, { "epoch": 0.9608938547486033, "grad_norm": 344.5935974121094, "learning_rate": 7.82122905027933e-08, "logits/chosen": -0.470703125, "logits/rejected": -0.5234375, "logps/chosen": -82.0, "logps/rejected": -116.0, "loss": 11.8641, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1513671875, "rewards/margins": 1.4609375, "rewards/rejected": -1.3125, "step": 344 }, { "epoch": 0.9636871508379888, "grad_norm": 330.0699462890625, "learning_rate": 7.262569832402235e-08, "logits/chosen": -0.498046875, "logits/rejected": -0.462890625, "logps/chosen": -85.5, "logps/rejected": -98.5, "loss": 15.8691, "rewards/accuracies": 0.71875, "rewards/chosen": -0.1416015625, "rewards/margins": 0.625, "rewards/rejected": -0.76953125, "step": 345 }, { "epoch": 0.9664804469273743, "grad_norm": 378.1785888671875, "learning_rate": 6.703910614525139e-08, "logits/chosen": -0.5078125, "logits/rejected": -0.515625, "logps/chosen": -100.5, "logps/rejected": -112.0, "loss": 17.3486, "rewards/accuracies": 0.6875, "rewards/chosen": -0.10986328125, "rewards/margins": 0.640625, "rewards/rejected": -0.75, "step": 346 }, { "epoch": 0.9692737430167597, "grad_norm": 320.7427062988281, "learning_rate": 6.145251396648044e-08, "logits/chosen": -0.5078125, "logits/rejected": -0.51171875, "logps/chosen": -101.0, "logps/rejected": -118.0, "loss": 11.9368, "rewards/accuracies": 0.8125, "rewards/chosen": 0.20703125, "rewards/margins": 1.2734375, "rewards/rejected": -1.0625, "step": 347 }, { "epoch": 0.9720670391061452, "grad_norm": 337.927734375, "learning_rate": 5.586592178770949e-08, "logits/chosen": -0.4765625, "logits/rejected": -0.4375, "logps/chosen": -100.5, "logps/rejected": -158.0, "loss": 13.3818, "rewards/accuracies": 0.625, "rewards/chosen": 0.15625, "rewards/margins": 1.15625, "rewards/rejected": -1.0, "step": 348 }, { "epoch": 0.9748603351955307, "grad_norm": 306.9811096191406, "learning_rate": 5.027932960893855e-08, "logits/chosen": -0.466796875, "logits/rejected": -0.484375, "logps/chosen": -89.5, "logps/rejected": -99.0, "loss": 14.4644, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1630859375, "rewards/margins": 0.93359375, "rewards/rejected": -0.76953125, "step": 349 }, { "epoch": 0.9776536312849162, "grad_norm": 365.86920166015625, "learning_rate": 4.4692737430167595e-08, "logits/chosen": -0.462890625, "logits/rejected": -0.47265625, "logps/chosen": -103.5, "logps/rejected": -106.5, "loss": 12.1478, "rewards/accuracies": 0.8125, "rewards/chosen": 0.037353515625, "rewards/margins": 1.1953125, "rewards/rejected": -1.15625, "step": 350 }, { "epoch": 0.9804469273743017, "grad_norm": 338.0594177246094, "learning_rate": 3.910614525139665e-08, "logits/chosen": -0.453125, "logits/rejected": -0.49609375, "logps/chosen": -71.5, "logps/rejected": -100.5, "loss": 15.0887, "rewards/accuracies": 0.78125, "rewards/chosen": 0.248046875, "rewards/margins": 0.9609375, "rewards/rejected": -0.7109375, "step": 351 }, { "epoch": 0.9832402234636871, "grad_norm": 330.7111511230469, "learning_rate": 3.3519553072625695e-08, "logits/chosen": -0.44140625, "logits/rejected": -0.470703125, "logps/chosen": -86.0, "logps/rejected": -90.0, "loss": 10.8306, "rewards/accuracies": 0.875, "rewards/chosen": 0.4140625, "rewards/margins": 1.296875, "rewards/rejected": -0.88671875, "step": 352 }, { "epoch": 0.9860335195530726, "grad_norm": 398.0047912597656, "learning_rate": 2.7932960893854745e-08, "logits/chosen": -0.470703125, "logits/rejected": -0.4609375, "logps/chosen": -98.5, "logps/rejected": -140.0, "loss": 18.1465, "rewards/accuracies": 0.75, "rewards/chosen": 0.043212890625, "rewards/margins": 0.64453125, "rewards/rejected": -0.6015625, "step": 353 }, { "epoch": 0.9888268156424581, "grad_norm": 357.8365783691406, "learning_rate": 2.2346368715083798e-08, "logits/chosen": -0.453125, "logits/rejected": -0.486328125, "logps/chosen": -88.5, "logps/rejected": -93.5, "loss": 18.5137, "rewards/accuracies": 0.65625, "rewards/chosen": 0.06982421875, "rewards/margins": 0.546875, "rewards/rejected": -0.478515625, "step": 354 }, { "epoch": 0.9916201117318436, "grad_norm": 407.08837890625, "learning_rate": 1.6759776536312847e-08, "logits/chosen": -0.4765625, "logits/rejected": -0.515625, "logps/chosen": -95.5, "logps/rejected": -87.5, "loss": 18.2456, "rewards/accuracies": 0.625, "rewards/chosen": -0.10498046875, "rewards/margins": 0.53125, "rewards/rejected": -0.63671875, "step": 355 }, { "epoch": 0.994413407821229, "grad_norm": 368.1312561035156, "learning_rate": 1.1173184357541899e-08, "logits/chosen": -0.484375, "logits/rejected": -0.47265625, "logps/chosen": -100.0, "logps/rejected": -91.0, "loss": 15.1653, "rewards/accuracies": 0.8125, "rewards/chosen": 0.06689453125, "rewards/margins": 0.8828125, "rewards/rejected": -0.81640625, "step": 356 }, { "epoch": 0.9972067039106145, "grad_norm": 380.1946716308594, "learning_rate": 5.5865921787709494e-09, "logits/chosen": -0.52734375, "logits/rejected": -0.494140625, "logps/chosen": -79.0, "logps/rejected": -108.0, "loss": 14.8149, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0079345703125, "rewards/margins": 0.84375, "rewards/rejected": -0.8359375, "step": 357 }, { "epoch": 1.0, "grad_norm": 296.95989990234375, "learning_rate": 0.0, "logits/chosen": -0.447265625, "logits/rejected": -0.470703125, "logps/chosen": -86.5, "logps/rejected": -104.0, "loss": 12.7576, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1767578125, "rewards/margins": 1.1484375, "rewards/rejected": -0.97265625, "step": 358 } ], "logging_steps": 1, "max_steps": 358, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }