Transformers
Safetensors
trl
grpo
arabic-poetry
classical-arabic
lora
Shaer-adapters-grpo / last-checkpoint /trainer_state.json
AhmadAbbass's picture
Training in progress, step 1, checkpoint
726b32a verified
Raw
History Blame
4.36 kB
{
"best_global_step": 1,
"best_metric": 0.42203541100025177,
"best_model_checkpoint": "/root/workspace/Shaer/grpo/outputs/sanity_check/sanity_20260411_123535/checkpoint-1",
"epoch": 0.5,
"eval_steps": 1,
"global_step": 1,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.10928299836814404,
"clip_ratio/high_mean": 0.10928299836814404,
"clip_ratio/low_mean": 0.09094957076013088,
"clip_ratio/low_min": 0.09094957076013088,
"clip_ratio/region_mean": 0.20023256912827492,
"completions/clipped_ratio": 0.25,
"completions/max_length": 640.0,
"completions/max_terminated_length": 237.0,
"completions/mean_length": 282.125,
"completions/mean_terminated_length": 162.83334350585938,
"completions/min_length": 86.0,
"completions/min_terminated_length": 86.0,
"entropy": 3.2345626056194305,
"epoch": 0.5,
"frac_reward_zero_std": 0.0,
"grad_norm": 4.5472893714904785,
"kl": 0.9608133509755135,
"learning_rate": 1e-05,
"loss": 0.0268,
"num_tokens": 3887.0,
"reward": 0.2736811637878418,
"reward_exact_count_bonus_mean": 0.25,
"reward_exact_count_bonus_std": 0.4629100561141968,
"reward_meter_mean": 0.22368116676807404,
"reward_meter_std": 0.30434706807136536,
"reward_std": 0.25279727578163147,
"reward_total_mean": 0.2736811637878418,
"rewards/exact_count_bonus/mean": 0.25,
"rewards/exact_count_bonus/std": 0.4629100561141968,
"rewards/meter/mean": 0.22368116676807404,
"rewards/meter/std": 0.30434706807136536,
"sampling/importance_sampling_ratio/max": 2.0,
"sampling/importance_sampling_ratio/mean": 0.9976902008056641,
"sampling/importance_sampling_ratio/min": 0.24163144826889038,
"sampling/sampling_logp_difference/max": 1.4203417301177979,
"sampling/sampling_logp_difference/mean": 0.15930314362049103,
"step": 1
},
{
"epoch": 0.5,
"eval_clip_ratio/high_max": 0.0,
"eval_clip_ratio/high_mean": 0.0,
"eval_clip_ratio/low_mean": 0.0,
"eval_clip_ratio/low_min": 0.0,
"eval_clip_ratio/region_mean": 0.0,
"eval_completions/clipped_ratio": 0.0,
"eval_completions/max_length": 156.0,
"eval_completions/max_terminated_length": 156.0,
"eval_completions/mean_length": 106.125,
"eval_completions/mean_terminated_length": 106.125,
"eval_completions/min_length": 69.25,
"eval_completions/min_terminated_length": 69.25,
"eval_entropy": 2.1008258759975433,
"eval_frac_reward_zero_std": 0.0,
"eval_kl": 1.3679395914077759,
"eval_loss": 0.0866735428571701,
"eval_num_tokens": 3887.0,
"eval_reward": 0.42203541100025177,
"eval_reward_exact_count_bonus_mean": 0.9375,
"eval_reward_exact_count_bonus_std": 0.125,
"eval_reward_meter_mean": 0.23453541472554207,
"eval_reward_meter_std": 0.22889509424567223,
"eval_reward_std": 0.2391926608979702,
"eval_reward_total_mean": 0.42203541100025177,
"eval_rewards/exact_count_bonus/mean": 0.9375,
"eval_rewards/exact_count_bonus/std": 0.125,
"eval_rewards/meter/mean": 0.23453541472554207,
"eval_rewards/meter/std": 0.22889509424567223,
"eval_runtime": 15.7215,
"eval_samples_per_second": 0.509,
"eval_sampling/importance_sampling_ratio/max": 1.2397247850894928,
"eval_sampling/importance_sampling_ratio/mean": 0.9995981901884079,
"eval_sampling/importance_sampling_ratio/min": 0.7994033098220825,
"eval_sampling/sampling_logp_difference/max": 0.24606388807296753,
"eval_sampling/sampling_logp_difference/mean": 0.034631784074008465,
"eval_steps_per_second": 0.127,
"step": 1
}
],
"logging_steps": 1,
"max_steps": 2,
"num_input_tokens_seen": 3887,
"num_train_epochs": 1,
"save_steps": 1,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}