JinanAzem's picture
Upload folder using huggingface_hub
be5c83c verified
Raw
History Blame Contribute Delete
8.58 kB
{
"best_global_step": 100,
"best_metric": 0.6545524597167969,
"best_model_checkpoint": "checkpoints/ft_jais_simdpo/dpo_run/checkpoint-100",
"epoch": 1.5625,
"eval_steps": 50,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.8328714728355407,
"epoch": 0.15625,
"grad_norm": 3.5907697677612305,
"learning_rate": 2.25e-05,
"logits/chosen": 0.9851744980764,
"logits/rejected": 0.9132862824057325,
"logps/chosen": -80.49798936843872,
"logps/rejected": -87.13544521331787,
"loss": 0.691208028793335,
"mean_token_accuracy": 0.8373994886875152,
"num_tokens": 16910.0,
"rewards/accuracies": 0.4125,
"rewards/chosen": 0.005871815676800907,
"rewards/margins": 0.0046546274214051666,
"rewards/rejected": 0.0012171887326985597,
"step": 10
},
{
"entropy": 0.8236085653305054,
"epoch": 0.3125,
"grad_norm": 3.045801877975464,
"learning_rate": 4.75e-05,
"logits/chosen": 0.9432169298637705,
"logits/rejected": 0.9300128951388309,
"logps/chosen": -80.01706008911133,
"logps/rejected": -86.19765682220459,
"loss": 0.6912835597991943,
"mean_token_accuracy": 0.8420414581894875,
"num_tokens": 33876.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.046248766069766134,
"rewards/margins": 0.0050085548544302584,
"rewards/rejected": 0.04124021101742983,
"step": 20
},
{
"entropy": 0.8710977151989937,
"epoch": 0.46875,
"grad_norm": 4.131756782531738,
"learning_rate": 4.9662976890711167e-05,
"logits/chosen": 0.952295882064034,
"logits/rejected": 0.8837412199420139,
"logps/chosen": -83.00751543045044,
"logps/rejected": -89.77082118988037,
"loss": 0.6836707592010498,
"mean_token_accuracy": 0.830362756550312,
"num_tokens": 51751.0,
"rewards/accuracies": 0.55,
"rewards/chosen": 0.19173650545999407,
"rewards/margins": 0.02175652077421546,
"rewards/rejected": 0.1699799854774028,
"step": 30
},
{
"entropy": 0.8702168866991997,
"epoch": 0.625,
"grad_norm": 3.4390907287597656,
"learning_rate": 4.850961997099892e-05,
"logits/chosen": 0.9335240972164126,
"logits/rejected": 0.8931220467287231,
"logps/chosen": -78.64973669052124,
"logps/rejected": -83.12959709167481,
"loss": 0.680081558227539,
"mean_token_accuracy": 0.8323500514030456,
"num_tokens": 68855.0,
"rewards/accuracies": 0.575,
"rewards/chosen": 0.5641312405467034,
"rewards/margins": 0.03580198623239994,
"rewards/rejected": 0.5283292587846518,
"step": 40
},
{
"entropy": 0.8412925243377686,
"epoch": 0.78125,
"grad_norm": 3.696289539337158,
"learning_rate": 4.657412981885862e-05,
"logits/chosen": 0.9247626503111631,
"logits/rejected": 0.9220718661915835,
"logps/chosen": -68.65432586669922,
"logps/rejected": -82.09786891937256,
"loss": 0.628887414932251,
"mean_token_accuracy": 0.8538857877254487,
"num_tokens": 86484.0,
"rewards/accuracies": 0.775,
"rewards/chosen": 1.0782162077724933,
"rewards/margins": 0.16525846347212791,
"rewards/rejected": 0.9129577524960041,
"step": 50
},
{
"epoch": 0.78125,
"eval_entropy": 0.8311625965710344,
"eval_logits/chosen": 0.9525682816067235,
"eval_logits/rejected": 0.9378524862311701,
"eval_logps/chosen": -70.774687273749,
"eval_logps/rejected": -77.4474421534045,
"eval_loss": 0.663590133190155,
"eval_mean_token_accuracy": 0.8474541881988789,
"eval_num_tokens": 86484.0,
"eval_rewards/accuracies": 0.6724137931034483,
"eval_rewards/chosen": 1.197298473325269,
"eval_rewards/margins": 0.1253269150339324,
"eval_rewards/rejected": 1.0719715516115058,
"eval_runtime": 3.6052,
"eval_samples_per_second": 15.811,
"eval_steps_per_second": 8.044,
"step": 50
},
{
"entropy": 0.9258149698376655,
"epoch": 0.9375,
"grad_norm": 9.48177433013916,
"learning_rate": 4.392089757165841e-05,
"logits/chosen": 0.9196924747627211,
"logits/rejected": 0.9150918054479149,
"logps/chosen": -69.63652791976929,
"logps/rejected": -74.67644653320312,
"loss": 0.6724472045898438,
"mean_token_accuracy": 0.8314912617206573,
"num_tokens": 103165.0,
"rewards/accuracies": 0.6,
"rewards/chosen": 1.612139716744423,
"rewards/margins": 0.10208179727196694,
"rewards/rejected": 1.5100578874349595,
"step": 60
},
{
"entropy": 0.9276665955781936,
"epoch": 1.09375,
"grad_norm": 4.742893218994141,
"learning_rate": 4.0638192674691136e-05,
"logits/chosen": 0.9372565226225635,
"logits/rejected": 0.8758297012073308,
"logps/chosen": -72.57800025939942,
"logps/rejected": -75.22021579742432,
"loss": 0.5596485137939453,
"mean_token_accuracy": 0.8355538666248321,
"num_tokens": 120923.0,
"rewards/accuracies": 0.75,
"rewards/chosen": 1.6647123485803603,
"rewards/margins": 0.3873647030442953,
"rewards/rejected": 1.2773476531729102,
"step": 70
},
{
"entropy": 0.9321356564760208,
"epoch": 1.25,
"grad_norm": 3.8452413082122803,
"learning_rate": 3.683522627621608e-05,
"logits/chosen": 0.9183959182419773,
"logits/rejected": 0.8850714484434743,
"logps/chosen": -73.9180368423462,
"logps/rejected": -87.95330810546875,
"loss": 0.4759009838104248,
"mean_token_accuracy": 0.8352961301803589,
"num_tokens": 138825.0,
"rewards/accuracies": 0.8,
"rewards/chosen": 1.2514840960502625,
"rewards/margins": 0.6839764896780253,
"rewards/rejected": 0.5675076065585017,
"step": 80
},
{
"entropy": 0.9279324404895306,
"epoch": 1.40625,
"grad_norm": 5.118920803070068,
"learning_rate": 3.263851792039109e-05,
"logits/chosen": 0.8924988958553159,
"logits/rejected": 0.8284702619552127,
"logps/chosen": -71.48162698745728,
"logps/rejected": -83.52158260345459,
"loss": 0.39791891574859617,
"mean_token_accuracy": 0.8307904973626137,
"num_tokens": 155378.0,
"rewards/accuracies": 0.8875,
"rewards/chosen": 1.317165607213974,
"rewards/margins": 0.9690214801579714,
"rewards/rejected": 0.34814412128180267,
"step": 90
},
{
"entropy": 0.9241503536701202,
"epoch": 1.5625,
"grad_norm": 7.398733615875244,
"learning_rate": 2.81876864133027e-05,
"logits/chosen": 0.9289504257072073,
"logits/rejected": 0.9161463222864651,
"logps/chosen": -62.29160423278809,
"logps/rejected": -79.298428440094,
"loss": 0.41886510848999026,
"mean_token_accuracy": 0.8381225109100342,
"num_tokens": 171778.0,
"rewards/accuracies": 0.7875,
"rewards/chosen": 1.9696232751011848,
"rewards/margins": 1.0112529575824738,
"rewards/rejected": 0.9583703201264143,
"step": 100
},
{
"epoch": 1.5625,
"eval_entropy": 0.8753328939964031,
"eval_logits/chosen": 0.980303409740094,
"eval_logits/rejected": 0.9663606126464863,
"eval_logps/chosen": -59.93091070240941,
"eval_logps/rejected": -69.91863198115908,
"eval_loss": 0.6545524597167969,
"eval_mean_token_accuracy": 0.8393763550396623,
"eval_num_tokens": 171778.0,
"eval_rewards/accuracies": 0.6551724137931034,
"eval_rewards/chosen": 2.281676158822816,
"eval_rewards/margins": 0.45682352164696005,
"eval_rewards/rejected": 1.8248526556738491,
"eval_runtime": 3.6534,
"eval_samples_per_second": 15.602,
"eval_steps_per_second": 7.938,
"step": 100
}
],
"logging_steps": 10,
"max_steps": 192,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.070816827686912e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}