{"timestamp_utc": "2026-04-11T12:37:27Z", "mode": "train", "global_step": 1, "epoch": 0.5, "loss": 0.0268, "grad_norm": 4.5472893714904785, "learning_rate": 1e-05, "num_tokens": 3887.0, "completions/mean_length": 282.125, "completions/min_length": 86.0, "completions/max_length": 640.0, "completions/clipped_ratio": 0.25, "completions/mean_terminated_length": 162.83334350585938, "completions/min_terminated_length": 86.0, "completions/max_terminated_length": 237.0, "rewards/meter/mean": 0.22368116676807404, "rewards/meter/std": 0.30434706807136536, "rewards/exact_count_bonus/mean": 0.25, "rewards/exact_count_bonus/std": 0.4629100561141968, "reward": 0.2736811637878418, "reward_std": 0.25279727578163147, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.15930314362049103, "sampling/sampling_logp_difference/max": 1.4203417301177979, "sampling/importance_sampling_ratio/min": 0.24163144826889038, "sampling/importance_sampling_ratio/mean": 0.9976902008056641, "sampling/importance_sampling_ratio/max": 2.0, "kl": 0.9608133509755135, "entropy": 3.2345626056194305, "clip_ratio/low_mean": 0.09094957076013088, "clip_ratio/low_min": 0.09094957076013088, "clip_ratio/high_mean": 0.10928299836814404, "clip_ratio/high_max": 0.10928299836814404, "clip_ratio/region_mean": 0.20023256912827492, "reward_total_mean": 0.2736811637878418, "reward_meter_mean": 0.22368116676807404, "reward_meter_std": 0.30434706807136536, "reward_exact_count_bonus_mean": 0.25, "reward_exact_count_bonus_std": 0.4629100561141968} {"timestamp_utc": "2026-04-11T12:37:42Z", "mode": "eval", "global_step": 1, "epoch": 0.5, "eval_loss": 0.0866735428571701, "eval_runtime": 15.7215, "eval_samples_per_second": 0.509, "eval_steps_per_second": 0.127, "eval_num_tokens": 3887.0, "eval_completions/mean_length": 106.125, "eval_completions/min_length": 69.25, "eval_completions/max_length": 156.0, "eval_completions/clipped_ratio": 0.0, "eval_completions/mean_terminated_length": 106.125, "eval_completions/min_terminated_length": 69.25, "eval_completions/max_terminated_length": 156.0, "eval_rewards/meter/mean": 0.23453541472554207, "eval_rewards/meter/std": 0.22889509424567223, "eval_rewards/exact_count_bonus/mean": 0.9375, "eval_rewards/exact_count_bonus/std": 0.125, "eval_reward": 0.42203541100025177, "eval_reward_std": 0.2391926608979702, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.034631784074008465, "eval_sampling/sampling_logp_difference/max": 0.24606388807296753, "eval_sampling/importance_sampling_ratio/min": 0.7994033098220825, "eval_sampling/importance_sampling_ratio/mean": 0.9995981901884079, "eval_sampling/importance_sampling_ratio/max": 1.2397247850894928, "eval_kl": 1.3679395914077759, "eval_entropy": 2.1008258759975433, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.42203541100025177, "eval_reward_meter_mean": 0.23453541472554207, "eval_reward_meter_std": 0.22889509424567223, "eval_reward_exact_count_bonus_mean": 0.9375, "eval_reward_exact_count_bonus_std": 0.125} {"timestamp_utc": "2026-04-11T12:37:51Z", "mode": "train", "global_step": 2, "epoch": 1.0, "loss": 0.0936, "grad_norm": 10.63160228729248, "learning_rate": 5e-06, "num_tokens": 5744.0, "completions/mean_length": 71.875, "completions/min_length": 35.0, "completions/max_length": 146.0, "completions/clipped_ratio": 0.0, "completions/mean_terminated_length": 71.875, "completions/min_terminated_length": 35.0, "completions/max_terminated_length": 146.0, "rewards/meter/mean": 0.3511555790901184, "rewards/meter/std": 0.30735185742378235, "rewards/exact_count_bonus/mean": 1.0, "rewards/exact_count_bonus/std": 0.0, "reward": 0.5511556267738342, "reward_std": 0.16572850942611694, "frac_reward_zero_std": 0.0, "sampling/sampling_logp_difference/mean": 0.18746040761470795, "sampling/sampling_logp_difference/max": 1.7690210342407227, "sampling/importance_sampling_ratio/min": 0.17049983143806458, "sampling/importance_sampling_ratio/mean": 0.9942735433578491, "sampling/importance_sampling_ratio/max": 2.0, "kl": 1.4957870244979858, "entropy": 2.25409172475338, "clip_ratio/low_mean": 0.12490623071789742, "clip_ratio/low_min": 0.12490623071789742, "clip_ratio/high_mean": 0.11229794658720493, "clip_ratio/high_max": 0.11229794658720493, "clip_ratio/region_mean": 0.23720417730510235, "reward_total_mean": 0.5511556267738342, "reward_meter_mean": 0.3511555790901184, "reward_meter_std": 0.30735185742378235, "reward_exact_count_bonus_mean": 1.0, "reward_exact_count_bonus_std": 0.0} {"timestamp_utc": "2026-04-11T12:38:05Z", "mode": "eval", "global_step": 2, "epoch": 1.0, "eval_loss": 0.06863964349031448, "eval_runtime": 14.0, "eval_samples_per_second": 0.571, "eval_steps_per_second": 0.143, "eval_num_tokens": 5744.0, "eval_completions/mean_length": 97.8125, "eval_completions/min_length": 69.0, "eval_completions/max_length": 140.75, "eval_completions/clipped_ratio": 0.0, "eval_completions/mean_terminated_length": 97.8125, "eval_completions/min_terminated_length": 69.0, "eval_completions/max_terminated_length": 140.75, "eval_rewards/meter/mean": 0.40700408816337585, "eval_rewards/meter/std": 0.3741379380226135, "eval_rewards/exact_count_bonus/mean": 1.0, "eval_rewards/exact_count_bonus/std": 0.0, "eval_reward": 0.6070040911436081, "eval_reward_std": 0.30008064955472946, "eval_frac_reward_zero_std": 0.0, "eval_sampling/sampling_logp_difference/mean": 0.03424238506704569, "eval_sampling/sampling_logp_difference/max": 0.24058371782302856, "eval_sampling/importance_sampling_ratio/min": 0.7956851571798325, "eval_sampling/importance_sampling_ratio/mean": 0.9988586455583572, "eval_sampling/importance_sampling_ratio/max": 1.2537521719932556, "eval_kl": 1.46183642745018, "eval_entropy": 2.2587124407291412, "eval_clip_ratio/low_mean": 0.0, "eval_clip_ratio/low_min": 0.0, "eval_clip_ratio/high_mean": 0.0, "eval_clip_ratio/high_max": 0.0, "eval_clip_ratio/region_mean": 0.0, "eval_reward_total_mean": 0.6070040911436081, "eval_reward_meter_mean": 0.40700408816337585, "eval_reward_meter_std": 0.3741379380226135, "eval_reward_exact_count_bonus_mean": 1.0, "eval_reward_exact_count_bonus_std": 0.0} {"timestamp_utc": "2026-04-11T12:38:07Z", "mode": "train", "global_step": 2, "epoch": 1.0, "train_runtime": 62.6885, "train_samples_per_second": 0.255, "train_steps_per_second": 0.032, "total_flos": 0.0, "train_loss": 0.060226328670978546}