{ "best_global_step": 100, "best_metric": 0.6545524597167969, "best_model_checkpoint": "checkpoints/ft_jais_simdpo/dpo_run/checkpoint-100", "epoch": 1.5625, "eval_steps": 50, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.8328714728355407, "epoch": 0.15625, "grad_norm": 3.5907697677612305, "learning_rate": 2.25e-05, "logits/chosen": 0.9851744980764, "logits/rejected": 0.9132862824057325, "logps/chosen": -80.49798936843872, "logps/rejected": -87.13544521331787, "loss": 0.691208028793335, "mean_token_accuracy": 0.8373994886875152, "num_tokens": 16910.0, "rewards/accuracies": 0.4125, "rewards/chosen": 0.005871815676800907, "rewards/margins": 0.0046546274214051666, "rewards/rejected": 0.0012171887326985597, "step": 10 }, { "entropy": 0.8236085653305054, "epoch": 0.3125, "grad_norm": 3.045801877975464, "learning_rate": 4.75e-05, "logits/chosen": 0.9432169298637705, "logits/rejected": 0.9300128951388309, "logps/chosen": -80.01706008911133, "logps/rejected": -86.19765682220459, "loss": 0.6912835597991943, "mean_token_accuracy": 0.8420414581894875, "num_tokens": 33876.0, "rewards/accuracies": 0.5625, "rewards/chosen": 0.046248766069766134, "rewards/margins": 0.0050085548544302584, "rewards/rejected": 0.04124021101742983, "step": 20 }, { "entropy": 0.8710977151989937, "epoch": 0.46875, "grad_norm": 4.131756782531738, "learning_rate": 4.9662976890711167e-05, "logits/chosen": 0.952295882064034, "logits/rejected": 0.8837412199420139, "logps/chosen": -83.00751543045044, "logps/rejected": -89.77082118988037, "loss": 0.6836707592010498, "mean_token_accuracy": 0.830362756550312, "num_tokens": 51751.0, "rewards/accuracies": 0.55, "rewards/chosen": 0.19173650545999407, "rewards/margins": 0.02175652077421546, "rewards/rejected": 0.1699799854774028, "step": 30 }, { "entropy": 0.8702168866991997, "epoch": 0.625, "grad_norm": 3.4390907287597656, "learning_rate": 4.850961997099892e-05, "logits/chosen": 0.9335240972164126, "logits/rejected": 0.8931220467287231, "logps/chosen": -78.64973669052124, "logps/rejected": -83.12959709167481, "loss": 0.680081558227539, "mean_token_accuracy": 0.8323500514030456, "num_tokens": 68855.0, "rewards/accuracies": 0.575, "rewards/chosen": 0.5641312405467034, "rewards/margins": 0.03580198623239994, "rewards/rejected": 0.5283292587846518, "step": 40 }, { "entropy": 0.8412925243377686, "epoch": 0.78125, "grad_norm": 3.696289539337158, "learning_rate": 4.657412981885862e-05, "logits/chosen": 0.9247626503111631, "logits/rejected": 0.9220718661915835, "logps/chosen": -68.65432586669922, "logps/rejected": -82.09786891937256, "loss": 0.628887414932251, "mean_token_accuracy": 0.8538857877254487, "num_tokens": 86484.0, "rewards/accuracies": 0.775, "rewards/chosen": 1.0782162077724933, "rewards/margins": 0.16525846347212791, "rewards/rejected": 0.9129577524960041, "step": 50 }, { "epoch": 0.78125, "eval_entropy": 0.8311625965710344, "eval_logits/chosen": 0.9525682816067235, "eval_logits/rejected": 0.9378524862311701, "eval_logps/chosen": -70.774687273749, "eval_logps/rejected": -77.4474421534045, "eval_loss": 0.663590133190155, "eval_mean_token_accuracy": 0.8474541881988789, "eval_num_tokens": 86484.0, "eval_rewards/accuracies": 0.6724137931034483, "eval_rewards/chosen": 1.197298473325269, "eval_rewards/margins": 0.1253269150339324, "eval_rewards/rejected": 1.0719715516115058, "eval_runtime": 3.6052, "eval_samples_per_second": 15.811, "eval_steps_per_second": 8.044, "step": 50 }, { "entropy": 0.9258149698376655, "epoch": 0.9375, "grad_norm": 9.48177433013916, "learning_rate": 4.392089757165841e-05, "logits/chosen": 0.9196924747627211, "logits/rejected": 0.9150918054479149, "logps/chosen": -69.63652791976929, "logps/rejected": -74.67644653320312, "loss": 0.6724472045898438, "mean_token_accuracy": 0.8314912617206573, "num_tokens": 103165.0, "rewards/accuracies": 0.6, "rewards/chosen": 1.612139716744423, "rewards/margins": 0.10208179727196694, "rewards/rejected": 1.5100578874349595, "step": 60 }, { "entropy": 0.9276665955781936, "epoch": 1.09375, "grad_norm": 4.742893218994141, "learning_rate": 4.0638192674691136e-05, "logits/chosen": 0.9372565226225635, "logits/rejected": 0.8758297012073308, "logps/chosen": -72.57800025939942, "logps/rejected": -75.22021579742432, "loss": 0.5596485137939453, "mean_token_accuracy": 0.8355538666248321, "num_tokens": 120923.0, "rewards/accuracies": 0.75, "rewards/chosen": 1.6647123485803603, "rewards/margins": 0.3873647030442953, "rewards/rejected": 1.2773476531729102, "step": 70 }, { "entropy": 0.9321356564760208, "epoch": 1.25, "grad_norm": 3.8452413082122803, "learning_rate": 3.683522627621608e-05, "logits/chosen": 0.9183959182419773, "logits/rejected": 0.8850714484434743, "logps/chosen": -73.9180368423462, "logps/rejected": -87.95330810546875, "loss": 0.4759009838104248, "mean_token_accuracy": 0.8352961301803589, "num_tokens": 138825.0, "rewards/accuracies": 0.8, "rewards/chosen": 1.2514840960502625, "rewards/margins": 0.6839764896780253, "rewards/rejected": 0.5675076065585017, "step": 80 }, { "entropy": 0.9279324404895306, "epoch": 1.40625, "grad_norm": 5.118920803070068, "learning_rate": 3.263851792039109e-05, "logits/chosen": 0.8924988958553159, "logits/rejected": 0.8284702619552127, "logps/chosen": -71.48162698745728, "logps/rejected": -83.52158260345459, "loss": 0.39791891574859617, "mean_token_accuracy": 0.8307904973626137, "num_tokens": 155378.0, "rewards/accuracies": 0.8875, "rewards/chosen": 1.317165607213974, "rewards/margins": 0.9690214801579714, "rewards/rejected": 0.34814412128180267, "step": 90 }, { "entropy": 0.9241503536701202, "epoch": 1.5625, "grad_norm": 7.398733615875244, "learning_rate": 2.81876864133027e-05, "logits/chosen": 0.9289504257072073, "logits/rejected": 0.9161463222864651, "logps/chosen": -62.29160423278809, "logps/rejected": -79.298428440094, "loss": 0.41886510848999026, "mean_token_accuracy": 0.8381225109100342, "num_tokens": 171778.0, "rewards/accuracies": 0.7875, "rewards/chosen": 1.9696232751011848, "rewards/margins": 1.0112529575824738, "rewards/rejected": 0.9583703201264143, "step": 100 }, { "epoch": 1.5625, "eval_entropy": 0.8753328939964031, "eval_logits/chosen": 0.980303409740094, "eval_logits/rejected": 0.9663606126464863, "eval_logps/chosen": -59.93091070240941, "eval_logps/rejected": -69.91863198115908, "eval_loss": 0.6545524597167969, "eval_mean_token_accuracy": 0.8393763550396623, "eval_num_tokens": 171778.0, "eval_rewards/accuracies": 0.6551724137931034, "eval_rewards/chosen": 2.281676158822816, "eval_rewards/margins": 0.45682352164696005, "eval_rewards/rejected": 1.8248526556738491, "eval_runtime": 3.6534, "eval_samples_per_second": 15.602, "eval_steps_per_second": 7.938, "step": 100 } ], "logging_steps": 10, "max_steps": 192, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.070816827686912e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }